导航

CloudFlare爬虫好哥哥们怎么绕过的

#1
爬虫如何绕过CloudFlare爬取数据
表哥们有没有好姿势
设置延迟好也不行呀,表哥们来聊聊
用的扩展油猴脚本绕过,这抓取的效率也太低了,而且也需要自己去关注的

查了下资料说可以采用cloudscraper来绕过cloudflare
代码为:import cloudscraper
from lxml.html import fromstring
import os, sys, re
import requests
scraper=cloudscraper.create_scraper(browser={
        'browser': 'firefox',
        'platform': 'windows',
        'mobile': False
    })
resp = scraper.get('要爬取的网页的url链接').text

我测试了下好像不行呀
2023-05-22
#2
试试Codebase
2023-05-23
#3
python seleiumn有一个扩展库,叫nc   全拼忘了叫啥了,这个模块可以过,就是爬的慢毕竟是seleiumn
2023-05-24
#4
import undetected_chromedriver
2023-05-24
#5
Traceback (most recent call last):
  File "C:\Users\Administrator\PycharmProjects\pythonProject\main.py", line 9, in <module>
    with Chrome(options=options) as driver:
  File "C:\Users\Administrator\PycharmProjects\pythonProject\venv\lib\site-packages\undetected_chromedriver\__init__.py", line 386, in __init__
    if self.patcher.version_main < 108:
TypeError: '<' not supported between instances of 'NoneType' and 'int'

老哥最新版的undetected3.47和Chrome最新版 113.0.5672.127 没法兼容吗... 运行失败
2023-05-24
#6
回复 4# oopww
试了半天,不知道是不是我的浏览器版本太高了,他不支持...
2023-05-26
#7
https://blog.csdn.net/m0_68075044/article/details/129252803 这个看看
2023-05-29
#8
回复 6# h4ste
我是centos,指定好版本号,driver = uc.Chrome(version_main = 113)
2023-05-29
#9
回复 8# oopww
谢谢师傅,待会去试试