您的位置:首页 > 新闻资讯 >文章内容
爬虫配代理IP和UA爬取顺利,绕过反爬虫机制
来源:互联网 作者:admin 时间:2019-04-08 17:05:00

  网上对于爬虫采集的教程或者是一些讨论都比较多的,如果我们要去爬取一个网站的信息,大家可能最先想的是对方有什么反爬虫机制。是的,这个问题是非常关键的,而且还是必须要解决的。


  就像爬取知乎,如果想大量并发的话的就必须配置最新代理IP。因为知乎的反爬策略就是并发过大就会限制你的爬虫,页面会自动重定向到验证码页面。所以防止你的爬虫被禁,设置个代理和UA还是很有必要的。


  首先呢,如果有钱的话建议自己去购买个比较高级的代理IP,这种代理响应速度比一般的要快很多。知乎对爬虫限制相对来说没有那么严格,所以一般的IP也没啥用(当然我说的单台),如果你部署多台的话有个代理IP是很爽的,方便快捷。


  找代理IP,大家自行百度,我就不多说了,基本每个代理都有免费的额度。如,机灵代理,黑洞HTTP等等。


  先把UA池配了,爬虫应该UA池是必须配的。


  在中加入下面的代码:


爬虫配代理IP和UA爬取顺利,绕过反爬虫机制


  UA池,百度一搜一大堆。


  在中间件中写入下面的代码。使用代理IP池的方法可以去GitHub上搜proxy,很多。


爬虫配代理IP和UA爬取顺利,绕过反爬虫机制

爬虫配代理IP和UA爬取顺利,绕过反爬虫机制


  在新建一个py文件放入下面的代码:


爬虫配代理IP和UA爬取顺利,绕过反爬虫机制


  到这配置基本就结束了。在中修改下面的代码:


爬虫配代理IP和UA爬取顺利,绕过反爬虫机制


  完全结束,启动项目就会发现请求是从代理IP发出的。如果配合scrapy-redis配置多台应该效率还是可以的。


  基本上,爬虫都是要配代理IP和UA的,否则很难可以爬取的,因为对方拒绝如此粗暴的爬取,这会给服务器带来影响,可能还会损害自己的利益,当然是禁止的。不过你有张良计,我有过墙梯,爬虫总是能找到方法来解决的。


相关文章内容简介
推荐阅读
  • 22 2019-05
    IP被封最快的破解方法是用代理IP

    IP被封最快的破解方法是用代理IP,如果等平台把你被封的IP进行解封,最快也要几个小时,或者24小时,或者几天,甚至于更久,这样你就无法在短期内进行使用了。因此,IP被封最快的破解方

  • 06 2020-02
    代理ip对工作的帮助

    大家都知道可以通过使用代理IP,可以避免泄露我们的真实IP,其实代理IP还有很多工作中需要用到它,可以对我们的工作带来很多帮助,下面就为大家进行详细的介绍。

  • 29 2019-04
    代理IP无效时会显示本地IP吗?

    代理IP无效时会显示本地IP吗?使用代理IP本来就是为了能隐藏好我们本地IP的,如果达不到这个目的,那就没有意义了。所以大家就会担心代理IP无效时会不会显示本地IP,结果是会还是不会呢?

  • 17 2020-10
    选择安全性高的代理ip

    网络上有很多的代理服务器,无论是免费的还是付费的,都非常多,对于代理ip,一般用户不会做很深的研究。

  • 14 2020-09
    ip代理的资源怎么获得

    现在动态代理IP有很多地方都用的到,所以很多人使用。现在有很多商家都可以提供动态代理IP,那么,动态代理IP商提供的IP是哪里来的呢?

  • 13 2019-05
    代理IP的作用和分类

    代理IP的作用和分类,知道的人有多少?尽管代理IP的使用非常广泛,并且使用它的人数在增加,但仍有许多新手不了解代理IP的作用,有哪些类型?我们今天讨论代理IP的分类。

在线咨询
大客户经理
大客户经理
1829380381
13316264505

大客户经理微信

微信公众号

微信公众号

回到顶部