剛才(cái)提到百(bǎi)度(dù)搜(sōu)索(suǒ)引擎(qíng)會(huì)設(shè)計復雜的抓取策(cè)略,其(qí)實(shí)搜(sōu)索引(yǐn)擎(qíng)與資源提(tí)供者之間存(cún)在相(xiāng)互依(yī)賴的(dí)關(guān)係(xì),其(qí)中(zhōng)搜索(suǒ)引(yǐn)擎需要(yào)站長(cháng)為其提供資源,否(fǒu)則(zé)搜索引(yǐn)擎(qíng)就無法滿(mǎn)足用戶檢索需(xū)求(qiú);而(ér)站長需(xū)要(yào)通(tōng)過(guò)搜索引擎(qíng)將自(zì)己(jǐ)的 內(nèi)容推廣(guǎng)出去獲取更多(duō)的受眾。spider抓(zhuā)取(qǔ)係統直(zhí)接涉(shè)及互聯網資源提供者的利益(yì),為(wéi)了使(shǐ)搜素(sù)引(yǐn)擎與(yǔ)站(zhàn)長能(néng)夠(gòu)達到雙贏,在抓(zhuā)取過程中(zhōng)雙(shuāng)方(fāng)必須遵(zūn)守(shǒu)一(yī)定的(dí) 規範,以(yǐ)便(biàn)於(yú)雙(shuāng)方(fāng)的(dí)數據處(chǔ)理及對接(jiē)。這種過(guò)程(chéng)中遵守(shǒu)的規範(fàn)也就(jiù)是日常中(zhōng)我(wǒ)們所說的一些(xiē)網絡(luò)協議(yì)。
以下簡單(dān)列舉:
http協議:超(chāo)文本傳(chuán)輸協議,是互聯網上應用最(zuì)為廣泛的(dí)一(yī)種網(wǎng)絡(luò)協(xié)議(yì),客戶端(duān)和服(fú)務(wù)器端(duān)請求和(hé)應答的(dí)標準(zhǔn)。客(kè)戶端一般情況(kuàng)是(shì)指(zhǐ)終(zhōng)端(duān)用(yòng)戶,服務(wù)器端即指(zhǐ)網 站。終端(duān)用戶(hù)通(tōng)過(guò)瀏覽器(qì),蜘蛛(zhū)等(děng)向服務(wù)器(qì)指定(dìng)端口發(fā)送(sòng)http請(qǐng)求。發(fā)送http請求(qiú)會返回對(duì)應的(dí)httpheader信息,可以(yǐ)看到包(bāo)括(kuò)是否成功(gōng),服務 器類(lèi)型(xíng),網頁最近更新時(shí)間等內(nèi)容(róng)。
https協議:實際(jì)是(shì)加(jiā)密版http,一種更加安全的(dí)數據傳輸協議。
UA屬性(xìng):UA即user-agent,是http協(xié)議中(zhōng)的(dí)一個屬(shǔ)性(xìng),代(dài)表了終端的(dí)身份(fèn),向服(fú)務器端(duān)表(biǎo)明我是(shì)誰來(lái)幹(gān)嘛(má),進(jìn)而服務器(qì)端(duān)可以根據不同的身份來做出不同的(dí)反(fǎn)饋(kuì)結果。
robots協(xié)議:robots.txt是(shì)搜索引擎(qíng)訪(fǎng)問一個網站時(shí)要(yào)訪(fǎng)問的第(dì)一個文件(jiàn),用(yòng)以來(lái)確定哪些(xiē)是被允許抓(zhuā)取的哪些(xiē)是被禁止抓取的(dí)。 robots.txt必(bì)須放在網(wǎng)站(zhàn)根(gēn)目(mù)錄(lù)下(xià),且文件名要小寫(xiě)。詳(xiáng)細的robots.txt寫法(fǎ)可參(cān)考(kǎo) 。百度嚴格按照robots協議執行,另外(wài),同樣(yàng)支(zhī)持網頁(yè)內容中添(tiān)加(jiā)的名(míng)為robots的(dí)meta標(biāo) 簽,index,follow,nofollow等指(zhǐ)令(líng)。
轉載(zǎi)請(qǐng)保留原文地(dì)址(zhǐ): https://antelcom.cn/show-548.html

