当前位置:主页 > 宁波 >

亚马逊

火车头使用Post方法采集Ajax页面教程_我的网站

8090

一 |     

     阿里云优惠券 先领券再下单        前面有写过一篇瀑布流的采集方法,今天在添加一个POST方法来采集Ajax刷新页面的教程。    秋高气爽,阳光明媚。    之前的文章请看:火车头采集动态加载Ajax数据(无分页瀑布流网站)    如果遇到POST方法来架子Ajax数据,这和我之前写的是两个类型,瀑布流是直接刷新出数据的页面。    采集网站分析    采集任何一个新站前我们都要对他进行一番分析才好下手。    列表页分析    这个网站的列表页,前面并不是通过Ajax加载的。CTRL+U可以直接看到列表内容,通过浏览器也看不到相关请求地址。    

    因为习惯原因,我直接看了下尾页列表页。9月22日上午,在顺城区前甸镇东华园社区内的休憩连廊,75岁的社区居民安景林正在指挥小乐队演奏,轻快、舒心的民乐曲不断在社区里飞扬。

二 | 然后顺手CTRL+U看看网站代码结构有没有大的变化。           园区洁净宜人、绿树成荫。防止后期采集出错。当日是星期天——上班族休息的日子,孩子们在家长的陪伴下,在园区内娱乐玩耍,一些老年居民还在园区内支起桌子打起了扑克,吸引了其他人的围观。

三 | 结果就发现无法看到列表内容。浏览器可以看到一个通过post请求的地址。           住在居家养老服务中心的老人们,也出门晒太阳,享受秋日的暖阳。

四 |     

    这时候就意识到这网站列表页可能后面的应该全是通过Ajax加载的。负责人王淑华向记者介绍,为让老年人在家门口就能享受到便捷的养老服务,社区带领居民走出“小家”融入“大家”,建立了居家养老服务中心,为老人提供一系列优质居家服务。           今年9月,东华园长者食在24号楼开业,不但年长者可以进餐,周边百姓都可享用。

五 | 记者在长者食堂看到,食堂菜品有十多种,就餐者不但能吃饱还能吃好。    通过笨方法,手动访问页面看看Ajax加载大概是哪些。           社区退休居民赵玉静对记者说,她家原来在榆林采煤沉陷区居住,房屋面积才57平方米,每次去同学家看到宽敞明亮的客厅,自己都非常羡慕。最后找到大概从2200页左右开始Ajax加载。    那我们采集的时候,前面的列表页就可以使用普通方式去采集(速度更快)。    2200页开始到尾页就通过post请求Ajax页面数据。

六 |     抓包获取Post数据    这个Ajax地址我在浏览器看不到任何跟页码有关的数据。她回忆说:“几年前,政府为我们这里实施了采煤沉陷搬迁安置,我听说后非常高兴,好几天睡不着觉,及时去申请报名。

七 | 最后只能使用抓包工具看一下详细的请求内容了。

八 |     

    使用抓包工具Fiddler    Fiddler下载地址:OneDrive-Fiddler-Setup_v5.0.20204.45441.zip    安装设置完成后我们打开浏览器。现在我居住在100多平方米的房子里,别提有多高兴了,生活真是无忧无虑。”            便捷出行,是东华园社区的又一亮点。2019年1月,为了给社区居民创造良好的出行条件,政府又在社区东侧建立了城东公交停保场并启动运行,目前有10多条公交线路在东华园社区到站停靠。重新访问一下采集页面,Fiddler会抓到很多请求地址。

九 |            如今的东华园小区居民,在出行、购物、游乐、就医、上学等民生事项上,皆享受到了前所未有的便利,生活品质显著提升。           东华园小区是抚顺市采煤沉陷避险搬迁安置小区,也是抚顺采煤沉陷避险搬迁最大的集中建设的小区,占地面积近30万平方米。由北向南流淌的浑河支流鲍家河贯穿在园区中央,将小区分为东西两个园区。    查看分析Post数据    Ctrl+F 我们搜索那个Ajax地址    

火车头使用Post方法采集Ajax页面教程
    Fiddler会以黄色将搜索到的结果显示出来,我们点击一下他。

十 |            2013年,这个小区启动建设,历时3年竣工。    

火车头使用Post方法采集Ajax页面教程
    在Fiddler右侧会显示这个请求地址的相关详细信息。小区内共有74栋楼房,容纳6500户居民入住,人口达到1.2万人。

十一 | 在鲍家河上,还有一座新改建的便民桥被百姓称之为“连心桥”,将东西园区连为一体。           2020年9月,东华园党群服务中心全面建成,面积达到800平方米,是集志愿服务活动展示、理论教学实践、党建成果展示和服务居民多功能于一体的综合性场所。

十二 |     

    信息顶部可以看到是post请求方法。东华园社区正如习近平总书记所期望的那样,阵地建设提升了,环境卫生改善了,百姓生活过好了,居民的幸福指数进一步提高了。                   责任编辑:刘春阳。    可以看到有我们请求的页码相关内容。

十三 |     

    访问不同页码的页面,经过研究发现规律。    
    currentPageIndex的值和页码相关,值等于页码减一。我们访问6139页时,currentPageIndex值是6138。    这就找到了规律,我们打开火车头采集器。    火车头采集器配置分页设置    起始网址填入Ajax请求地址    
    点“高级模式”。    
    点“分页设置”,http请求方式“post”。    
    把我们Fiddler抓包获取的内容填进去。    
    将currentPageIndex值的内容替换成火车头采集器的“分页”标签。    
    下面填入页码。

十四 |     页面地址是从2200到6140,上面我们分析得出post请求内容的currentPageIndex值是实际页码减一。所以这里面我们填2199到6139.    

    网址获取选项设置    为了筛选出我们需要的内容,我们设置一下网址获取选项。    打开浏览器F12开发工具,预览一下Ajax获取的内容。    
    可以看到链接的形式是    自考成考报名条件有哪些?    完整的链接地址是    https://域名/chengrenzikao/20200611152022.html    那我们就可以使用下面的规则提取地址。    
    我们测试一下网址采集。    测试网址采集    点击测试可能提示“post请求必须选择网页编码”我们在火车头其他设置中将编码选为“UTF8”即可。    
    可以看到已经正确获取到了链接。不放心可以复制链接实际访问一下看看是否正确。

十五 |     

    注意事项    采集过程注意运行线程和请求间隔时间。教程在测试时因为开的线程较多,频率过高导致对方网站开启了防CC设置。拉黑了我一个服务器IP,此教程写完用了两台服务器。

十六 |     我们实际采集可以只开1个线程,并设置合适的间隔时间,比如1000ms到1500ms左右。    本文来自2号站长网,转载请注明出处:https://www.zz2zz.com/331414.html

        
    

申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!。

Current article:http://3chnb.zhuangnaorunjingzhabao.sbs/zd3uy/20260826/9618556.html

Published on:01:18:10


Copyright @ 2016-2017 我的网站 版权所有