導航:首頁 > 軟體知識 > 哪個是百度抓取程序的名稱

哪個是百度抓取程序的名稱

發布時間:2023-08-03 22:01:22

❶ 百度是用什麼技術搜索的

網路有一個蜘蛛程序,也叫網路蜘蛛
什麼是網路蜘蛛
網路蜘蛛即Web Spider,是一個很形象的名字。把互聯網比喻成一個蜘蛛網,那麼Spider就是在網上爬來爬去的蜘蛛。網路蜘蛛是通過網頁的鏈接地址來尋找網頁,從網站某一個頁面(通常是首頁)開始,讀取網頁的內容,找到在網頁中的其它鏈接地址,然後通過這些鏈接地址尋找下一個網頁,這樣一直循環下去,直到把這個網站所有的網頁都抓取完為止。如果把整個互聯網當成一個網站,那麼網路蜘蛛就可以用這個原理把互聯網上所有的網頁都抓取下來。
蜘蛛工作原理
對於搜索引擎來說,要抓取互聯網上所有的網頁幾乎是不可能的,從目前公布的數據來看,容量最大的搜索引擎也不過是抓取了整個網頁數量的百分之四十左右。這其中的原因一方面是抓取技術的瓶頸,100億網頁的容量是100×2000G位元組,即使能夠存儲,下載也存在問題(按照一台機器每秒下載20K計算,需要340台機器不停的下載一年時間,才能把所有網頁下載完畢)。同時,由於數據量太大,在提供搜索時也會有效率方面的影響。因此,許多搜索引擎的網路蜘蛛只是抓取那些重要的網頁,而在抓取的時候評價重要性主要的依據是某個網頁的鏈接深度。 搜索引擎抓取策略
在抓取網頁的時候,網路蜘蛛一般有兩種策略:廣度優先和深度優先(如下圖所示)。廣度優先是指網路蜘蛛會先抓取起始網頁中鏈接的所有網頁,然後再選擇其中的一個鏈接網頁,繼續抓取在此網頁中鏈接的所有網頁。這是最常用的方式,因為這個方法可以讓網路蜘蛛並行處理,提高其抓取速度。深度優先是指網路蜘蛛會從起始頁開始,一個鏈接一個鏈接跟蹤下去,處理完這條線路之後再轉入下一個起始頁,繼續跟蹤鏈接。這個方法有個優點是網路蜘蛛在設計的時候比較容易。

閱讀全文

與哪個是百度抓取程序的名稱相關的資料

熱點內容
熊貓的市場在哪裡 瀏覽:127
什麼是大數據特點是 瀏覽:758
技術總監與技術經理哪個職位高 瀏覽:863
袋泡茶屬於什麼產品 瀏覽:870
是利用什麼來傳遞信息的 瀏覽:650
阿里發布產品型號是什麼 瀏覽:358
如何讓兩個程序在一起 瀏覽:883
做百威啤酒代理要多少錢 瀏覽:479
買到假劣產品怎麼舉報 瀏覽:552
外國資本在國內有多少代理人 瀏覽:683
存款交易成功是什麼意思 瀏覽:142
淘寶小陽是賣什麼產品的 瀏覽:568
樓盤整體平面圖有哪些數據 瀏覽:893
計算機市場調研哪個方向比較好 瀏覽:746
開診所市場營銷手段有哪些 瀏覽:238
拼多多如何改秒拼產品 瀏覽:244
汽車過戶後網上信息最遲多久更新 瀏覽:212
現在工廠學不到什麼技術 瀏覽:327
什麼逐步提出建立碳排放交易市場 瀏覽:768
快遞信息是什麼地方發 瀏覽:630