网站抓取精灵火车采集器的多页抓取教程

作者：dong 发布于：2016-5-24 10:02 Tuesday 分类：官方公告

    熟悉网站采集的朋友应该都知道，当我们要采集的信息不在当前默认页，而在当前默认页

某一个链接的所在页时，我们就需要用到多页地址管理，在火车采集器V9中多页管理的操作如下：

我们以内容页网址 http://kimi201406.1688.com/page/creditdetail.htm 为例，来获取它的公司介绍和联系方式页面的联系方式信息。

公司介绍在网址 http://kimi201406.1688.com/page/creditdetail.htm 里获取，而联系方式信息在网址http://kimi201406.1688.com/page/contactinfo.htm 里获取。所以我们需要借助多页功能来实现。前者叫默认页地址，后者叫做多页地址。

流程：点击①创建多页，进行②多页设置，然后在数据来源③选择多页调用，最后根据多页源代码设置提取方式。

1@.png

下面重点讲解②，多页地址的两种获取方式：页面地址替换和源码中截取。

1.页面地址替换：也就是默认页和多页地址有相同的地方，通过简单的替换就可以变成多页地址。

比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址：“http: //kimi201406.1688.com/page/contactinfo.htm”之间的共同点，可以发现默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

设置如下图：

2@.png