零基礎寫python爬蟲之HTTP異常處理-CDA數據分析師官網

熱線電話：13121318867

登錄

首頁精彩閱讀零基礎寫python爬蟲之HTTP異常處理

零基礎寫python爬蟲之HTTP異常處理

2017-11-29

收藏

零基礎寫python爬蟲之HTTP異常處理

我們在使用爬蟲來抓取網頁內容的時候，HTTP異常是必須要注意的一項，所以本文，我們來詳細探尋一下HTTP異常處理的相關內容，通過一些具體的實例來分析一下，非常的簡單，但是卻很實用。

先來說一說HTTP的異常處理問題。
當urlopen不能夠處理一個response時，產生urlError。
不過通常的Python APIs異常如ValueError,TypeError等也會同時產生。
HTTPError是urlError的子類，通常在特定HTTP URLs中產生。

1.URLError
通常，URLError在沒有網絡連接(沒有路由到特定服務器)，或者服務器不存在的情況下產生。
這種情況下，異常同樣會帶有"reason"屬性，它是一個tuple（可以理解為不可變的數組），
包含了一個錯誤號和一個錯誤信息。
我們建一個urllib2_test06.py來感受一下異常的處理：

代碼如下:
import urllib2
req = urllib2.Request('http://www.baibai.com')
try: urllib2.urlopen(req)
except urllib2.URLError, e:
print e.reason

按下F5，可以看到打印出來的內容是：
[Errno 11001] getaddrinfo failed
也就是說，錯誤號是11001，內容是getaddrinfo failed

2.HTTPError

服務器上每一個HTTP 應答對象response包含一個數字"狀態碼"。
有時狀態碼指出服務器無法完成請求。默認的處理器會為你處理一部分這種應答。
例如:假如response是一個"重定向"，需要客戶端從別的地址獲取文檔，urllib2將為你處理。
其他不能處理的，urlopen會產生一個HTTPError。
典型的錯誤包含"404"(頁面無法找到)，"403"(請求禁止)，和"401"(帶驗證請求)。
HTTP狀態碼表示HTTP協議所返回的響應的狀態。
比如客戶端向服務器發送請求，如果成功地獲得請求的資源，則返回的狀態碼為200，表示響應成功。
如果請求的資源不存在，則通常返回404錯誤。

HTTP狀態碼通常分為5種類型，分別以1～5五個數字開頭，由3位整數組成：
------------------------------------------------------------------------------------------------
200：請求成功      處理方式：獲得響應的內容，進行處理
201：請求完成，結果是創建了新資源。新創建資源的URI可在響應的實體中得到    處理方式：爬蟲中不會遇到
202：請求被接受，但處理尚未完成    處理方式：阻塞等待
204：服務器端已經實現了請求，但是沒有返回新的信息。如果客戶是用戶代理，則無須為此更新自身的文檔視圖。    處理方式：丟棄
300：該狀態碼不被HTTP/1.0的應用程序直接使用，只是作為3XX類型回應的默認解釋。存在多個可用的被請求資源。    處理方式：若程序中能夠處理，則進行進一步處理，如果程序中不能處理，則丟棄
301：請求到的資源都會分配一個永久的URL，這樣就可以在將來通過該URL來訪問此資源    處理方式：重定向到分配的URL
302：請求到的資源在一個不同的URL處臨時保存     處理方式：重定向到臨時的URL
304 請求的資源未更新     處理方式：丟棄
400 非法請求     處理方式：丟棄
401 未授權     處理方式：丟棄
403 禁止     處理方式：丟棄
404 沒有找到     處理方式：丟棄
5XX 回應代碼以“5”開頭的狀態碼表示服務器端發現自己出現錯誤，不能繼續執行請求    處理方式：丟棄
------------------------------------------------------------------------------------------------

HTTPError實例產生后會有一個整型'code'屬性，是服務器發送的相關錯誤號。

Error Codes錯誤碼

因為默認的處理器處理了重定向(300以外號碼)，并且100-299范圍的號碼指示成功，所以你只能看到400-599的錯誤號碼。
BaseHTTPServer.BaseHTTPRequestHandler.response是一個很有用的應答號碼字典，顯示了HTTP協議使用的所有的應答號。
當一個錯誤號產生后，服務器返回一個HTTP錯誤號，和一個錯誤頁面。
你可以使用HTTPError實例作為頁面返回的應答對象response。
這表示和錯誤屬性一樣，它同樣包含了read,geturl,和info方法。
我們建一個urllib2_test07.py來感受一下：

代碼如下:
import urllib2
req = urllib2.Request('http://www.jb51.net/callmewhy')
try:
    urllib2.urlopen(req)
except urllib2.URLError, e:
    print e.code
    #print e.read()

按下F5可以看見輸出了404的錯誤碼，也就說沒有找到這個頁面。

3.Wrapping

所以如果你想為HTTPError或URLError做準備，將有兩個基本的辦法。推薦使用第二種。
我們建一個urllib2_test08.py來示范一下第一種異常處理的方案：

代碼如下:
from urllib2 import Request, urlopen, URLError, HTTPError
req = Request('http://www.jb51.net/callmewhy')
try:
    response = urlopen(req)
except HTTPError, e:
    print 'The server couldn\'t fulfill the request.'
    print 'Error code: ', e.code
except URLError, e:
    print 'We failed to reach a server.'
    print 'Reason: ', e.reason
else:
    print 'No exception was raised.'
    # everything is fine

和其他語言相似，try之后捕獲異常并且將其內容打印出來。
這里要注意的一點，except HTTPError 必須在第一個，否則except URLError將同樣接受到HTTPError 。
因為HTTPError是URLError的子類，如果URLError在前面它會捕捉到所有的URLError（包括HTTPError ）。

我們建一個urllib2_test09.py來示范一下第二種異常處理的方案：

代碼如下:

from urllib2 import Request, urlopen, URLError, HTTPError
req = Request('http://www.jb51.net/callmewhy')
try:
    response = urlopen(req)
except URLError, e:
    if hasattr(e, 'code'):
        print 'The server couldn\'t fulfill the request.'
        print 'Error code: ', e.code
    elif hasattr(e, 'reason'):
        print 'We failed to reach a server.'
        print 'Reason: ', e.reason
else:
    print 'No exception was raised.'
    # everything is fine

CDA數據分析師考試相關入口一覽（建議收藏）：

? 想報名CDA認證考試，點擊>>> “CDA報名” 了解CDA考試詳情；

? 想學習CDA考試教材，點擊>>> “CDA教材” 了解CDA考試詳情；

? 想加入CDA考試題庫，點擊>>> “CDA題庫” 了解CDA考試詳情；

? 想了解CDA考試含金量，點擊>>> “CDA含金量” 了解CDA考試詳情；

python

數據分析咨詢請掃描二維碼

若不方便掃碼，搜微信號：CDAshujufenxi

上一篇Excel-漏斗圖分析（差異分析）

下一篇大數據分析工程師薪資水平

數據分析師考試動態

考試介紹
考試大綱
考試內容
考試地點

CDA報考指南

報考流程
考試時間
報名費用
聯系我們

數據分析學習

數據分析師資訊

更多

Copyright © 2015-2021, www.ruiqisteel.com All Rights Reserved. CDA數據分析師(北京國富如荷網絡科技有限公司) 版權所有京ICP備11001960號-9

京公網安備 11010802034615號經營許可證編號：京B2-20210330

聯系電話：13321103290 (微信同號)

OK

免費資料
免費試聽
訂制課程
職業規劃
認證考試

客服在線

日韩人妻系列无码专区视频,先锋高清无码,无码免费视欧非,国精产品一区一区三区无码

客服在線

立即咨詢

免密碼登錄

提交首次登錄驗證后自動注冊