網頁爬蟲 - Python requests.get 爬蟲 設置代理 IP地址未改變
問題描述
工作需要爬取亞馬遜上面的信息,但是亞馬遜反爬蟲太厲害,同一個IP地址會被封。Python版本:3.6, IDE:Pycharm 2017.1在網上查了很多資料,requests庫的手冊也讀過,但是都是同一個方法,代碼如下:
import requests’’’代理IP地址(高匿)’’’proxy = {’HTTPS’: ’117.85.105.170:808’}’’’head 信息’’’head = {’User-Agent’: ’Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36’, ’Connection’: ’keep-alive’}’’’http://icanhazip.com會返回當前的IP地址’’’p = requests.get(’http://icanhazip.com’, headers=head, proxies=proxy)print(p.text)
根據我看過的許多教程的理論,如果代理設置成功,最后顯示的IP應該是代理的IP地址,但是最終還是我真實的IP地址,這樣一來不就等于沒有設置代理么?
問題解答
回答1:proxies在你訪問http時用http的設置,訪問https時用https的設置所以你的proxy需要同時包含http及https的配置,這樣才能生效
proxy = { ’http’: ’http://117.85.105.170:808’, ’https’: ’https://117.85.105.170:808’}
相關文章:
1. android - weex 項目createInstanceReferenceError: Vue is not defined2. PHPExcel表格導入數據庫怎么導入3. android - 哪位大神知道java后臺的api接口的對象傳到前端后輸入日期報錯,是什么情況?求大神指點4. javascript - 如圖,百度首頁,查看源代碼為什么什么都沒有?5. pdo 寫入到數據庫的內容為中文的時候寫入亂碼6. vue2.0+webpack 如何使用bootstrap?7. PHP類封裝的插入數據,總是插入不成功,返回false;8. docker綁定了nginx端口 外部訪問不到9. mac連接阿里云docker集群,已經卡了2天了,求問?10. ddos - apache日志很多其它網址,什么情況?
