導航:首頁 > 軟體知識 > 哪個是百度抓取程序的名稱

哪個是百度抓取程序的名稱

發布時間:2023-08-03 22:01:22

❶ 百度是用什麼技術搜索的

網路有一個蜘蛛程序,也叫網路蜘蛛
什麼是網路蜘蛛
網路蜘蛛即Web Spider,是一個很形象的名字。把互聯網比喻成一個蜘蛛網,那麼Spider就是在網上爬來爬去的蜘蛛。網路蜘蛛是通過網頁的鏈接地址來尋找網頁,從網站某一個頁面(通常是首頁)開始,讀取網頁的內容,找到在網頁中的其它鏈接地址,然後通過這些鏈接地址尋找下一個網頁,這樣一直循環下去,直到把這個網站所有的網頁都抓取完為止。如果把整個互聯網當成一個網站,那麼網路蜘蛛就可以用這個原理把互聯網上所有的網頁都抓取下來。
蜘蛛工作原理
對於搜索引擎來說,要抓取互聯網上所有的網頁幾乎是不可能的,從目前公布的數據來看,容量最大的搜索引擎也不過是抓取了整個網頁數量的百分之四十左右。這其中的原因一方面是抓取技術的瓶頸,100億網頁的容量是100×2000G位元組,即使能夠存儲,下載也存在問題(按照一台機器每秒下載20K計算,需要340台機器不停的下載一年時間,才能把所有網頁下載完畢)。同時,由於數據量太大,在提供搜索時也會有效率方面的影響。因此,許多搜索引擎的網路蜘蛛只是抓取那些重要的網頁,而在抓取的時候評價重要性主要的依據是某個網頁的鏈接深度。 搜索引擎抓取策略
在抓取網頁的時候,網路蜘蛛一般有兩種策略:廣度優先和深度優先(如下圖所示)。廣度優先是指網路蜘蛛會先抓取起始網頁中鏈接的所有網頁,然後再選擇其中的一個鏈接網頁,繼續抓取在此網頁中鏈接的所有網頁。這是最常用的方式,因為這個方法可以讓網路蜘蛛並行處理,提高其抓取速度。深度優先是指網路蜘蛛會從起始頁開始,一個鏈接一個鏈接跟蹤下去,處理完這條線路之後再轉入下一個起始頁,繼續跟蹤鏈接。這個方法有個優點是網路蜘蛛在設計的時候比較容易。

閱讀全文

與哪個是百度抓取程序的名稱相關的資料

熱點內容
票務代理里引流是什麼意思 瀏覽:373
怎麼代理多喜愛家紡產品 瀏覽:600
哪個公司pos機有代理功能 瀏覽:13
華為全球推廣片傳出的信息是什麼 瀏覽:16
信息軟體刪除了怎麼恢復蘋果 瀏覽:740
保險代理壓金怎麼退 瀏覽:431
葆嬰補鈣產品怎麼樣 瀏覽:353
任丘二踢腳市場怎麼樣 瀏覽:366
房地產發布信息平台有哪些 瀏覽:649
固態儲氫技術的原理是什麼 瀏覽:786
小程序開發哪裡有聚頂科技行 瀏覽:753
上海櫥櫃市場在哪裡 瀏覽:290
暗黑2單機和戰網哪個能裝備交易 瀏覽:956
大數據更新後怎麼樣 瀏覽:592
怎麼根據交易去查對應的日誌 瀏覽:476
產品經理培訓有哪些模型 瀏覽:546
海康北京總代理有哪些 瀏覽:115
哪個交易所有比特幣模擬盤 瀏覽:290
企業財務代理記賬費用多少 瀏覽:270
如何具備自己的交易系統 瀏覽:514