设为首页收藏本站

红色代码编程论坛

 找回密码
 加入我们
搜索
查看: 30|回复: 0

爬虫代理淘宝反爬基础(1)

[复制链接]
发表于 2020-6-29 17:28 | 显示全部楼层 |阅读模式
目前在对淘宝进行数据爬取的时候都会碰到,登入时的滑块问题,无论是手动还是脚本都不成功。这里的很重要一个原因是很多的网站都对selenium做了反爬虫机制。接下来是参考网上的方案,希望可以帮助到大家。注意这里使用的浏览器是Chrome。所以使用的驱动也是chromedriver
1、淘宝反爬
淘宝的反爬机制是非常完善的,在用selenium登陆淘宝的时候发现淘宝能检测到并弹出滑块,然后无论怎么滑动都通过不了,在经过一番搜索后发现很多网站对selenium都有检测机制,如检测是否存在特有标识 $cdc_asdjflasutopfhvcZLmcfl 、navigator.webdriver等。根据这条线索,可以在淘宝的js里找到了相关的检测代码:

在控制台下输入window.navigator.webdriver会发现和正常的浏览器打开的有所不同

2、修改selenium
如果浏览器是正常打开的话,navigator.webdriver大的值应该是undefined或者false,如果为true说明能检测到selenium
设置开发者模式
此步骤很重要,设置为开发者模式,防止被各大网站识别出来使用了Selenium
from selenium.webdriver import ChromeOptions
option = ChromeOptions()
option.add_experimental_option('excludeSwitches', ['enable-automation'])#开启实验性功能
browser=webdriver.Chrome(options=option)
# 修改get方法
script = '''
Object.defineProperty(navigator, 'webdriver', {
get: () => undefined
})
'''
browser.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {"source": script})
修改浏览器的webdriver
原因发现以后怎么去解决这个问题就比较头疼了,针对这个问题的两个解决方案,编辑chromedriver发现cdc_asdjflasutopfhvcZLmcfl是chromedriver里面的一个变量名,我们只需要将这个变量名改成其他的就好了,变量名修改教程在《Can a website detect when you are using selenium with chromedriver?》
Mac版本的可以通过如下方法将 cdc_ 替换为 dog_
perl -pi -e 's/cdc_/dog_/g' /path/to/chromedriver
//替换完成后查找下,如果查找不到说明替换成功了
perl -ne 'while(/cdc_/g){print "$&\n";}' /path/to/chromedriver
Windows或者Linux版本可以利用Vim将 cdc_ 替换为 dog_
vim /path/to/chromedriver
Mac和win已经修改好的最新版Chromedriver
爬虫是长期进行的任务,所以需要配合代理才能更好的获取数据,亿牛云爬虫代理加强版可以让我们爬虫程序长期稳定的进行数据采集。

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有帐号?加入我们 用百度帐号登录

x

积分兑换实物排行

您需要登录后才可以回帖 登录 | 加入我们 用百度帐号登录

本版积分规则

QQ|申请友链|小黑屋|手机版|Archiver|红色代码编程论坛 ( 鲁ICP备11027229号  

GMT+8, 2020-7-8 19:09 , Processed in 0.121094 second(s), 28 queries , Gzip On.

Powered by Discuz! X3.2

© 2001-2013 Comsenz Inc.

快速回复 返回顶部 返回列表