簡單來說互聯網是由一個個站點和網絡設備組成的大網,我們通過浏覽器訪問站點,站點把html、JS、CSS代碼返回給浏覽器,這些代碼經過浏覽器解析、渲染,将豐富多彩的網頁呈現我們眼前
如果我們把互聯網比作一張大的蜘蛛網,數據便是存放于蜘蛛網的各個節點,而Python爬蟲就是一隻小蜘蛛,
沿着網絡抓取自己的獵物(數據)爬蟲指的是:向網站發起請求,獲取資源後分析并提取有用數據的程序;
從技術層面來說就是 通過程序模拟浏覽器請求站點的行為,把站點返回的HTML代碼/json數據/二進制數據(圖片、視頻) 爬到本地,進而提取自己需要的數據,存放起來使用
Python爬蟲的基本原理
1、發起請求
使用http庫向目标站點發起請求,即發送一個Request
Request包含:請求頭、請求體等
Request模塊缺陷:不能執行JS 和CSS 代碼
2、獲取響應内容
如果服務器能正常響應,則會得到一個Response
Response包含:html,json,圖片,視頻等
3、解析内容
解析html數據:正則表達式(RE模塊),第三方解析庫如Beautifulsoup,pyquery等
解析json數據:json模塊
解析二進制數據:以wb的方式寫入文件
4、保存數據
數據庫(MySQL,Mongdb、Redis)
以上就是python爬蟲什麼意思的詳細内容,更多請關注其它相關文章!
更多技巧請《轉發 關注》哦!
,更多精彩资讯请关注tft每日頭條,我们将持续为您更新最新资讯!