爬取數據是什么意思


爬取數據是什么意思

文章插圖
【爬取數據是什么意思】爬取數據的意思就是通過程序來獲取需要的網站上的內容信息 , 比如文字、視頻、圖片等數據 。網絡爬蟲(又稱為網頁蜘蛛 , 網絡機器人 , 在FOAF社區中間 , 更經常的稱為網頁追逐者) , 是一種按照一定的規則 , 自動地抓取萬維網信息的程序或者腳本 。另外一些不常使用的名字還有螞蟻、自動索引、模擬程序或者蠕蟲 。
網絡爬蟲是一個自動提取網頁的程序 , 它為搜索引擎從萬維網上下載網頁 , 是搜索引擎的重要組成 。傳統爬蟲從一個或若干初始網頁的URL開始 , 獲得初始網頁上的URL , 在抓取網頁的過程中 , 不斷從當前頁面上抽取新的URL放入隊列 , 直到滿足系統的一定停止條件 。