网站抓取精灵火车采集器的多页抓取教程
作者:dong 发布于:2016-5-24 10:02 Tuesday 分类:官方公告
熟悉网站采集的朋友应该都知道,当我们要采集的信息不在当前默认页,而在当前默认页
某一个链接的所在页时,我们就需要用到多页地址管理,在火车采集器V9中多页管理的操作如下:
我们以内容页网址 http://kimi201406.1688.com/page/creditdetail.htm 为例,来获取它的公司介绍和联系方式页面的联系方式信息。
公司介绍在网址 http://kimi201406.1688.com/page/creditdetail.htm 里获取,而联系方式信息在网址http://kimi201406.1688.com/page/contactinfo.htm 里获取。所以我们需要借助多页功能来实现。前者叫默认页地址,后者叫做多页地址。
流程:点击①创建多页,进行②多页设置,然后在数据来源③选择多页调用,最后根据多页源代码设置提取方式。
下面重点讲解②,多页地址的两种获取方式:页面地址替换和源码中截取。
1.页面地址替换:也就是默认页和多页地址有相同的地方,通过简单的替换就可以变成多页地址。
比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址:“http: //kimi201406.1688.com/page/contactinfo.htm”之间的共同点,可以发现默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。
设置如下图:
注:正则表达式中 (.*)
为任意通配符。$1
,$2
…$
数字
来按照顺序对应上面(.*)
表示的部分。若要对多页源码部分区域做限定,可在指定多页源码区域设置。
若留空则默认返回多页整个源代码。设置好以后,点击测试查看结果即可。
2.源码中截取:也就是多页的地址在默认页的页面源代码里面。
如图,可以看到默认页源码中存在多页地址。
所以设置如下:
测试后如正确则保存即可。最后设置数据来源和提取方式,如图:
注:如需要多级多页,则在多页地址获取方式选择需要的多页即可
这两种获取方式大家掌握了吗,今后在抓取网站时使用火车采集器V9的上述操作就可以很容易地获取到关联的多页地址了,作为一款功能全面的网站抓取精灵,火车采集器一定会充分考虑到用户的使用需求,以及如何最大化实现便利。
联系我们
联系电话
-
0551-62864156
QQ邮件订阅
最新评论
- industrialegy
<a href="http://www.... - inve
这个采集到的视频地址 应该不是真实地址... - 云南桥架厂
我能说这个妹不错么 - 密密麻麻
win10 64位,处理后会留下原压缩包... - 平行进口车
以前经常用火车,来支持一下。 - 天津网站建设
文章采集器,厉害了 - 骗子医院
这个可以试试! - qq昵称
这么好的帖子,必须顶起来!! - 哈尔滨舒家网
试用一下,看是否能用。希望能用。火车头业... - 誉非
这个下载下来是安装程序,不是视频教程啊。
发表评论: