您的位置:首页 > 新闻资讯 >文章内容
爬虫借用代理IP获取到薪资信息
来源:互联网 作者:admin 时间:2019-04-28 10:41:09

  爬虫借用代理IP获取到薪资信息,为什么要这么麻烦呢?这是因为这些数据,网站并不想随便给你爬取,但如果你想知道一个比较准的结果,那么收集大量信息再分析,这结果无疑是更加的准确。


  而且,面对网站限制爬取薪资信息这种情况,我们可以使用代理IP来助阵的,就像机灵代理的使用,方便快捷。下面就来看看Python爬虫去拉勾网爬取薪资的过程。


  1.网页分析


  我们在查看拉勾网上的招聘信息的时候,搜索Python,或者是PHP等等的岗位信息,其实是向服务器发出相应请求,由服务器动态的响应请求,将我们所需要的内容通过浏览器解析,呈现在我们的面前。可以看到我们发出的请求当中,FormData中的kd参数,就代表着向服务器请求关键词为Python的招聘信息。


爬虫借用代理IP获取到薪资信息


  分析比较复杂的页面请求与响应信息,推荐使用Fiddler,对于分析网站来说绝对是一大杀器。不过比较简单的响应请求用浏览器自带的开发者工具就可以,比如像火狐的FireBug等等,只要轻轻一按F12,所有的请求的信息都会事无巨细的展现在你面前。


  经由分析网站的请求与响应过程可知,拉勾网的招聘信息都是由XHR动态传递的。我们发现,以POST方式发出的请求有两个,分别是companyAjax.json和positionAjax.json,它们分别控制当前显示的页面和页面中包含的招聘信息。


  可以看到,我们所需要的信息包含在positionAjax.json的Content->result当中,其中还包含了一些其他参数信息,包括总页面数(totalPageCount),总招聘登记数(totalCount)等相关信息。


  2.请求方式


  知道我们所要抓取的信息在哪里是最为首要的,知道信息位置之后,接下来我们就要考虑如何通过Python来模拟浏览器,获取这些我们所需要的信息。


  其中比较关键的步骤在于如何仿照浏览器的Post方式,来包装我们自己的请求。request包含的参数包括所要抓取的网页url,以及用于伪装的headers。urlopen中的data参数包括FormData的三个参数(first、pn、kd)。包装完毕之后,就可以像浏览器一样访问拉勾网,并获得页面数据了。


  3.抓取方式


  获得页面信息之后,我们就可以开始爬虫数据中最主要的步骤:抓取数据。


  抓取数据的方式有很多,像正则表达式re,lxml的etree,json,以及bs4的BeautifulSoup都是python3抓取数据的适用方法。大家可以根据实际情况,使用其中一个,又或多个结合使用。


  4.信息存储


  获得原始数据之后,为了进一步的整理与分析,我们有结构有组织的将抓取到的数据存储到excel中,方便进行数据的可视化处理。


  这是使用xlsxwriter存储的数据,没有问题,可以正常使用。到从为止,一个抓取拉勾网招聘信息的小爬虫就诞生了。


  如果爬虫借用代理IP获取到薪资信息,过程会简单快捷很多,不然一直被限制住,慢慢爬也不知道何年何月才能拿到结果了。


相关文章内容简介
推荐阅读
  • 18 2019-03
    动不动就上亿的播放量,这些数据是使用代理IP刷的吗?

    大家对于刷流量有没有什么概念呢?很多行业都存在刷流量的情况,这数据造假大家也不少见的,比如影视行业动不动就上亿的播放量。

  • 22 2019-08
    3种通过代理IP爬虫的方案

    代理IP在爬虫业务的应用是越来越广泛,根据不同的布局,爬虫的质量效果也会有所不同,下面跟大家介绍以下3种分布式爬虫的方式,每个方案的优缺点都可以直观看到。

  • 14 2019-05
    租用代理IP使用注意事项

    租用代理IP使用注意事项,大家在租用代理IP之前建议是要先了解下的。什么都不知道就跑去租用了,什么信息都无法对比,难找到好用的代理IP。那么我们租用代理IP使用,需要了解什么呢?

  • 10 2019-06
    http代理提取后用不了咋回事

    http代理提取后用不了咋回事?关于http代理不能用这个问题,有一小部分用户可能会遇上,这究竟是怎么回事呢?为何提取出来的http代理无法使用呢?

  • 18 2019-06
    用静态IP和动态IP代理的网速哪个快

    用静态IP和动态IP代理的网速哪个快?我们现在使用的IP大多数都是动态的,是不是使用静态IP比动态IP网速会更加快呢?不然为什么别人的网速这么快的呢?

  • 19 2019-06
    抓取数据时IP地址没有伪装好

    抓取数据时IP地址没有伪装好,这是很容易引起IP被封的,如果你的IP地址被封之后,就不能继续访问该网站了,那要等到多久这IP地址才会解封呢?这就难说,也许24小时,或者几天,几个月,

在线客服
大客户VIP渠道
点击这里给我发消息
讨论QQ群
HTTP代理IP爬虫
客服电话
13318873961