搜索引(yǐn)擎的工作的過程(chéng)非常復雜,而簡單(dān)的講搜索引擎(qíng)的(dí)工作(zuò)過程(chéng)大體可以(yǐ)分成三(sān)個階(jiē)段。
爬行和抓取:搜索引擎蜘蛛通過跟蹤鏈接訪問頁麵,獲取頁麵HTML代碼存入數據庫。 預處理:搜索贏球對抓取來的頁麵數據文字進行文字提取,中文分詞,索引等處理,以備排名程序調用。 排名:用戶輸入關鍵字後,排名調用索引庫數據,計算相關性,然後按一定格式生成搜索結果頁麵。
爬(pá)行(háng)和抓(zhuā)取(qǔ)
爬行和抓(zhuā)取(qǔ)是搜(sōu)索引(yǐn)擎工作的(dí)第一(yī)步(bù),完(wán)成數據收集(jí)任務。
蜘蛛
搜索引(yǐn)擎用來(lái)爬(pá)行和訪(fǎng)問(wèn)頁麵的程序(xù)被稱(chēng)為蜘(zhī)蛛(zhū)(spider),也(yě)稱(chēng)為機(jī)器(qì)人(rén)(bot)。
蜘蛛(zhū)代理(lǐ)名稱(chēng):
百度(dù)蜘蛛:Baiduspider+(+http://www.baidu.com/search/spider.htm) ·
雅虎中國(guó)蜘(zhī)蛛:Mozilla/5.0 (compatible; Yahoo! Slurp China; ) ·
英文(wén)雅虎蜘(zhī)蛛:Mozilla/5.0 (compatible; Yahoo! Slurp/3.0; )
Google 蜘(zhī)蛛(zhū):Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html) ·
微軟(ruǎn) Bing 蜘蛛:msnbot/1.1 (+http://search.msn.com/msnbot.htm)·
搜狗蜘蛛(zhū): Sogou+web+robot+(+http://www.sogou.com/docs/help/webmasters.htm#07) ·
搜搜蜘(zhī)蛛:Sosospider+(+http://help.soso.com/webspider.htm) ·
有道蜘(zhī)蛛:Mozilla/5.0 (compatible; YodaoBot/1.0; ; )
跟(gēn)蹤(zōng)鏈接(jiē)
為了抓取網上盡(jìn)量(liáng)多的頁麵,搜索(suǒ)引擎(qíng)蜘(zhī)蛛會跟(gēn)蹤頁(yè)麵(miàn)上(shàng)的鏈接,從一個(gè)頁麵爬到下(xià)一個頁(yè)麵,就好(hǎo)像蜘蛛(zhū)在蜘(zhī)蛛網上(shàng)爬(pá)行那樣(yàng),這也(yě)就是搜(sōu)索引(yǐn)擎(qíng)蜘蛛(zhū)這個(gè)名稱的由來(lái)。最(zuì)簡單(dān)的爬行遍歷(lì)策略(lüè)分(fēn)為(wéi)兩(liǎng)種(zhǒng),一(yī)是(shì)深度優(yōu)先(xiān),二(èr)是(shì)廣度(dù)優先(xiān)。
深度(dù)優(yōu)先搜索
深度優先搜索就是(shì)在搜索樹的(dí)每(měi)一層始(shǐ)終(zhōng)先(xiān)隻(zhī)擴展(zhǎn)一個子節點(diǎn),不斷地(dì)向縱深前(qián)進(jìn)直到不能再(zài)前(qián)進(到達葉子(zǐ)節點或(huò)受到深(shēn)度限(xiàn)製)時,才從當(dāng)前節點(diǎn)返(fǎn)回(huí)到上(shàng)一級(jí)節(jié)點,沿另一方向又(yòu)繼續前進(jìn)。這種(zhǒng)方法的(dí)搜(sōu)索樹是(shì)從(cóng)樹根開始一枝一(yī)枝(zhī)逐(zhú)漸形成的(dí)。
深度優先搜(sōu)索(suǒ)亦稱為縱向搜(sōu)索(suǒ)。由於(yú)一個有(yǒu)解的問題樹可能(néng)含有無(wú)窮分(fēn)枝(zhī),深(shēn)度優先搜(sōu)索如果誤入無(wú)窮分枝(即(jí)深(shēn)度無(wú)限(xiàn)),則不可(kě)能找到(dào)目(mù)標節(jié)點(diǎn)。所以(yǐ),深度(dù)優(yōu)先(xiān)搜(sōu)索策略是(shì)不(bù)完(wán)備(bèi)的。另外(wài),應用(yòng)此策略得到的解不一定是最佳(jiā)解(jiě)(最(zuì)短路(lù)徑(jìng))。
廣(guǎng)度(dù)優(yōu)先(xiān)搜(sōu)索
在深(shēn)度(dù)優先(xiān)搜索(suǒ)算法(fǎ)中(zhōng),是(shì)深度(dù)越(yuè)大的(dí)結點越(yuè)先得到擴展(zhǎn)。如果(guǒ)在搜索中把(bǎ)算法改(gǎi)為(wéi)按結(jié)點(diǎn)的層次進(jìn)行(háng)搜索, 本(běn)層(céng)的(dí)結(jié)點(diǎn)沒(méi)有搜(sōu)索處(chǔ)理(lǐ)完時,不能(néng)對下層結(jié)點(diǎn)進(jìn)行處理,即(jí)深度(dù)越(yuè)小的結(jié)點越先得(dé)到擴(kuò)展(zhǎn),也就是說(shuō)先產生 的(dí)結點先(xiān)得以擴(kuò)展處理,這種搜(sōu)索算法(fǎ)稱(chēng)為廣(guǎng)度(dù)優先(xiān)搜索(suǒ)法。
在深度優(yōu)先(xiān)搜(sōu)索(suǒ)算法中,是深度越大的(dí)結點越(yuè)先(xiān)得(dé)到擴展(zhǎn)。如果在(zài)搜索(suǒ)中(zhōng)把(bǎ)算法改(gǎi)為按結點(diǎn)的層次進(jìn)行搜索(suǒ), 本層(céng)的結點沒有搜索(suǒ)處(chǔ)理完時,不能對(duì)下層結點進行處理,即(jí)深度(dù)越小的(dí)結點(diǎn)越(yuè)先(xiān)得到擴(kuò)展(zhǎn),也就是說(shuō)先(xiān)產生(shēng) 的結(jié)點(diǎn)先(xiān)得(dé)以(yǐ)擴展(zhǎn)處理(lǐ),這種(zhǒng)搜(sōu)索(suǒ)算法稱(chēng)為廣(guǎng)度(dù)優(yōu)先搜(sōu)索(suǒ)法(fǎ)。
吸引蜘蛛(zhū)
哪些(xiē)頁麵(miàn)被認為比(bǐ)較重(zhòng)要呢?有幾(jī)方(fāng)麵(miàn)影(yǐng)響(xiǎng)因素(sù):
· 網站和(hé)頁麵(miàn)權重(zhòng)。質(zhì)量高,資格(gé)老(lǎo)的(dí)網站(zhàn)被認為權重比較(jiào)高(gāo),這種網(wǎng)站(zhàn)上(shàng)的頁麵(miàn)被(bèi)爬行的深度也(yě)會比(bǐ)較高,所以(yǐ)會有更多(duō)內(nèi)頁被收錄。
· 頁(yè)麵更新(xīn)度。蜘蛛每次(cì)爬行(háng)都會(huì)把(bǎ)頁麵數(shù)據(jù)存儲起來(lái)。如果第二(èr)次(cì)爬(pá)行(háng)發(fā)現(xiàn)頁麵(miàn)與第一(yī)次(cì)收(shōu)錄的(dí)完(wán)全一樣(yàng),說明頁麵(miàn)沒(méi)有更(gēng)新,蜘(zhī)蛛也(yě)就沒有(yǒu)必要(yào)經常(cháng)抓取。如果頁麵內容(róng)經常更(gēng)新(xīn),蜘(zhī)蛛就(jiù)會更加頻(pín)繁地訪問(wèn)這種頁(yè)麵,頁麵上出現(xiàn)的新(xīn)鏈(liàn)接(jiē),也自然會(huì)被蜘(zhī)蛛更快跟蹤(zōng),抓取新(xīn)頁麵。
· 導入(rù)鏈接。無論是外部鏈接(jiē)還(huán)是同一(yī)個(gè)網站的(dí)內部鏈(liàn)接(jiē),要被(bèi)蜘(zhī)蛛抓取(qǔ)就必須(xū)有導入(rù)鏈接(jiē)進(jìn)入(rù)頁麵,否則蜘蛛根本(běn)沒有(yǒu)機(jī)會知道頁(yè)麵(miàn)的(dí)存(cún)在。高質量(liáng)的(dí)導(dǎo)入鏈(liàn)接也經常(cháng)使頁麵上(shàng)的(dí)導(dǎo)出鏈(liàn)接被(bèi)爬行深度(dù)增加。一(yī)般來說網(wǎng)站(zhàn)上權重最高(gāo)的是首頁,大(dà)部(bù)分外部(bù)鏈接(jiē)是(shì)指向(xiàng)首頁(yè),蜘(zhī)蛛訪問(wèn)最頻繁的也(yě)是首頁。離首頁點擊(jī)距離越(yuè)近,頁(yè)麵權重(zhòng)越(yuè)高(gāo),被(bèi)蜘(zhī)蛛爬行的機會也越大(dà)。
地址(zhǐ)庫
為了(liǎo)避(bì)免重(zhòng)復(fù)爬行和抓取(qǔ)網(wǎng)址,搜索引擎會建立一個地址庫(kù),記(jì)錄(lù)已(yǐ)經(jīng)被(bèi)發現還沒有(yǒu)抓取的(dí)頁麵(miàn),以及已(yǐ)經(jīng)被抓取的頁麵。地址庫中的uRL有幾個來源:
(1)人工錄入的(dí)種子網(wǎng)站(zhàn)。
(2)蜘蛛(zhū)抓取(qǔ)頁(yè)麵(miàn)後,從(cóng)HTML中(zhōng)解析(xī)出(chū)新(xīn)的(dí)鏈接(jiē)uRL,與地址庫中的數據進行對(duì)比,如果(guǒ)是地(dì)址(zhǐ)庫(kù)中沒(méi)有(yǒu)的網(wǎng)址,就存入(rù)待(dài)訪(fǎng)問(wèn)地(dì)址庫(kù)。
(3)站長(cháng)通(tōng)過(guò)搜索(suǒ)引擎網(wǎng)頁提(tí)交表(biǎo)格提(tí)交(jiāo)進(jìn)來的網址(zhǐ)。
蜘(zhī)蛛按(àn)重要性(xìng)從待訪問(wèn)地址庫中提取uRL,訪(fǎng)問並(bìng)抓取(qǔ)頁(yè)麵(miàn),然(rán)後(hòu)把這個(gè)uRL從(cóng)待訪問地址庫中(zhōng)刪除,放進已(yǐ)訪問地址庫(kù)中(zhōng)。
大(dà)部(bù)分主流搜索(suǒ)引擎都提供(gōng)一個表(biǎo)格(gé),讓站長(cháng)提交網址。不過(guò)這些(xiē)提交來(lái)的網址都隻是存入(rù)地址庫(kù)而(ér)已(yǐ),是否收(shōu)錄還要(yào)看頁(yè)麵重要(yào)性如何(hé)。搜索(suǒ)引(yǐn)擎所收(shōu)錄(lù)的(dí)絕(jué)大(dà)部(bù)分頁麵是蜘蛛(zhū)自(zì)己(jǐ)跟蹤(zōng)鏈接(jiē)得到的。可以說提交頁麵基(jī)本t是毫無(wú)用(yòng)處(chǔ)的(dí),搜(sōu)索引擎更喜(xǐ)歡自(zì)己沿(yán)著鏈接(jiē)發現新頁(yè)麵(miàn)。
文(wén)件存儲搜索引擎蜘蛛抓(zhuā)取的數(shù)據存(cún)入原始(shǐ)頁(yè)麵(miàn)數據(jù)庫(kù)。其(qí)中的(dí)頁麵(miàn)數據(jù)與(yǔ)用戶(hù)瀏覽器得到的(dí)HTML是(shì)完全一(yī)樣的(dí)。每(měi)個uRI,都有(yǒu)一個(gè)獨(dú)特的文(wén)件編號(hào)。
爬行時(shí)的(dí)復製內(nèi)容(róng)檢測
檢測並(bìng)刪(shān)除(chú)復(fù)製內容(róng)通常(cháng)是在(zài)下(xià)麵(miàn)介紹的(dí)預(yù)處(chǔ)理(lǐ)過(guò)程(chéng)中進行(háng)的,但(dàn)現(xiàn)在的蜘蛛在爬(pá)行(háng)和抓(zhuā)取(qǔ)文件時(shí)也(yě)會(huì)進(jìn)行(háng)定程(chéng)度的(dí)復製內容檢(jiǎn)測。遇(yù)到權重很低(dī)的網站上大(dà)量轉載或抄襲(xí)內容(róng)時(shí),很(hěn)可能不(bù)再繼續(xù)爬(pá)行。這(zhè)也就是有(yǒu)的(dí)站(zhàn)長(cháng)在日誌(zhì)文件中發(fā)現了蜘蛛,但頁(yè)麵(miàn)從(cóng)來沒(méi)有被真(zhēn)正(zhèng)收(shōu)錄過(guò)的原(yuán)因。
預處理
在(zài)一(yī)些SEO材料中,“預處理”也被(bèi)簡稱為“索(suǒ)引(yǐn)”,因為索引(yǐn)是(shì)預(yù)處理最(zuì)主要的(dí)步驟(zhòu)。
搜索引擎(qíng)蜘(zhī)蛛(zhū)抓(zhuā)取的原(yuán)始頁麵,並不能(néng)直接(jiē)用(yòng)於(yú)查(chá)詢排(pái)名處理。搜索(suǒ)引擎數(shù)據(jù)庫中(zhōng)的(dí)頁麵(miàn)數都在(zài)數萬億(yì)級別(bié)以上(shàng),用(yòng)戶(hù)輸入(rù)搜索(suǒ)詞(cí)後,靠排(pái)名程(chéng)序實(shí)時(shí)對(duì)這(zhè)麼多頁(yè)麵(miàn)分析(xī)相(xiāng)關性(xìng),計算量太大,不(bù)可(kě)能(néng)在一兩(liǎng)秒內返(fǎn)回排(pái)名結(jié)果。因此抓取來(lái)的頁麵必(bì)須經過(guò)預處(chǔ)理(lǐ),為最(zuì)後(hòu)的查(chá)詢排(pái)名做好(hǎo)準備(bèi)。
和爬行抓(zhuā)取一樣(yàng),預處(chǔ)理也是在(zài)後台提前完成(chéng)的(dí),用戶(hù)搜索時感覺不到這個過程(chéng)。
1.提取(qǔ)文字(zì)
現在(zài)的(dí)搜(sōu)索引擎還(huán)是以(yǐ)文字(zì)內(nèi)容(róng)為基礎。蜘蛛(zhū)抓取到的頁(yè)麵中的(dí)HTML代碼(mǎ),除了(liǎo)用(yòng)戶(hù)在瀏(liú)覽器(qì)上(shàng)可(kě)以(yǐ)看到的可(kě)見文字外,還包(bāo)含了大量的(dí)HTML格式標簽(qiān), JavaScript程序(xù)等無法用(yòng)於排(pái)名的(dí)內容(róng)。搜索引擎預處(chǔ)理首先(xiān)要(yào)做的就(jiù)是從(cóng)HTML文(wén)件中(zhōng)去除(chú)標(biāo)簽,程序(xù),提取(qǔ)出可以用(yòng)於排名(míng)處(chǔ)理的網(wǎng)頁(yè)麵文字內(nèi) 容。
今天愚人(rén)節哈
除(chú)去HTML代碼後(hòu),剩(shèng)下(xià)的用於(yú)排名(míng)的(dí)文字隻(zhī)是(shì)這一(yī)行:
今天愚人節哈(hā)
除了可見文字,搜索引(yǐn)擎(qíng)也(yě)會提取出(chū)一些特殊(shū)的(dí)包含(hán)文字信息的(dí)代(dài)碼,如Meta標簽(qiān)中(zhōng)的(dí)文字(zì),圖(tú)片(piàn)替代(dài)文(wén)字,Flash文(wén)件的替(tì)代文字,鏈(liàn)接(jiē)錨文(wén)字等。
2.中(zhōng)文分詞
分詞(cí)是中文搜索引擎特有(yǒu)的步驟。搜索(suǒ)引擎(qíng)存(cún)儲和(hé)處(chǔ)理頁麵及(jí)用(yòng)戶(hù)搜索都是(shì)以(yǐ)詞為基礎的。英文(wén)等語言單(dān)詞與(yǔ)單(dān)詞之間(jiān)有(yǒu)空格分(fēn)隔,搜(sōu)索引擎索(suǒ)引程(chéng)序(xù)可(kě)以直(zhí)接把(bǎ)句(jù)子(zǐ) 劃分為單詞的集(jí)合。而(ér)中文詞(cí)與詞之(zhī)間(jiān)沒有(yǒu)任何分(fēn)隔符(fú),一個句子中(zhōng)的(dí)所(suǒ)有字(zì)和(hé)詞(cí)都(dū)是(shì)連(lián)在一起(qǐ)的(dí)。搜索引擎必須首(shǒu)先(xiān)分辨(biàn)哪(nǎ)幾(jī)個字(zì)組成一個詞,哪些字本身就(jiù)是一(yī) 個詞(cí)。比如(rú)“減(jiǎn)肥(féi)方法”將(jiāng)被(bèi)分詞(cí)為(wéi)“減肥”和(hé)“方法”兩(liǎng)個詞。
中(zhōng)文分詞方法(fǎ)基(jī)本上有(yǒu)兩種,一(yī)種(zhǒng)是基於詞典匹配(pèi),另一(yī)種(zhǒng)是基於統(tǒng)計(jì)。
基於(yú)詞典匹配(pèi)的(dí)方(fāng)法(fǎ)是指,將(jiāng)待分(fēn)析的一段漢(hàn)字與一個(gè)事(shì)先(xiān)造(zào)好(hǎo)的(dí)詞典中(zhōng)的(dí)詞條(tiáo)進行匹(pǐ)配(pèi),在待(dài)分(fēn)析(xī)漢字串(chuàn)中掃描到詞典中已有(yǒu)的(dí)詞(cí)條(tiáo)則匹配(pèi)成功,或(huò)者(zhě)說(shuō)切分出一個(gè)單(dān)詞(cí)。
按照掃描(miáo)方向,基於詞(cí)典的(dí)匹配(pèi)法(fǎ)可(kě)以(yǐ)分(fēn)為正(zhèng)向(xiàng)匹配和(hé)逆(nì)向(xiàng)匹配。按照(zhào)匹配長(cháng)度優(yōu)先級的不(bù)同,又可以分為(wéi)最大匹配(pèi)和(hé)最(zuì)小匹配。將掃描(miáo)方(fāng)向和長度(dù)優先(xiān)混合,又(yòu)可(kě)以(yǐ)產(chǎn)生(shēng)正(zhèng)向(xiàng)最大匹(pǐ)配,逆向最(zuì)大匹配等(děng)不同(tóng)方(fāng)法。
詞典(diǎn)匹配方法(fǎ)計(jì)算(suàn)簡單,其(qí)準確度(dù)在(zài)很大程度上(shàng)取(qǔ)決於詞(cí)典的(dí)完整(zhěng)性(xìng)和更新(xīn)情況。
基於統(tǒng)計(jì)的(dí)分詞方法指(zhǐ)的是分析(xī)大(dà)量(liáng)文(wén)字(zì)樣(yàng)本,計(jì)算出(chū)字(zì)與字相(xiāng)鄰出(chū)現(xiàn)的統計概率,幾(jī)個字相鄰(lín)出現越(yuè)多,就(jiù)越(yuè)可(kě)能(néng)形成一個(gè)單詞。基於(yú)統(tǒng)計的(dí)方法的優(yōu)勢(shì)是(shì)對(duì)新出(chū)現的(dí)詞反應更快速(sù),也(yě)有利於消除歧義。
基(jī)於(yú)詞(cí)典匹配和基於統(tǒng)計(jì)的分(fēn)詞(cí)方法各有(yǒu)優劣(liè),實際使用中(zhōng)的分詞係統都(dū)是(shì)混合(hé)使用兩種(zhǒng)方(fāng)法的,快速(sù)高效(xiào),又(yòu)能識別生詞,新詞,消(xiāo)除歧(qí)義。
中(zhōng)文(wén)分詞的準確(què)性往往影響(xiǎng)搜索引(yǐn)擎(qíng)排(pái)名(míng)的相(xiāng)關性(xìng)。比(bǐ)如在(zài)百度搜索(suǒ)“搜索引擎優(yōu)化”,從(cóng)快照(zhào)中可以(yǐ)看到,百度(dù)把“搜(sōu)索(suǒ)引(yǐn)擎(qíng)優化(huà)”這六(liù)個字當成(chéng)一個(gè)詞。
而在(zài)Google搜(sōu)索(suǒ)同樣的詞(cí),快照顯示(shì)Google將(jiāng)其分切為“搜索(suǒ)引(yǐn)擎(qíng)”和“優化(huà)”兩個詞。顯然(rán)百度(dù)切(qiē)分得更(gēng)為合(hé)理,搜(sōu)索引(yǐn)擎優(yōu)化是(shì)一(yī)個(gè)完整(zhěng)的概念(niàn)。Google分(fēn)詞時(shí)傾向於(yú)更為細(xì)碎(suì)。
這種(zhǒng)分詞(cí)上(shàng)的不(bù)同(tóng)很可(kě)能是一(yī)些(xiē)關(guān)鍵詞排名在不同(tóng)搜索引擎(qíng)有不(bù)同(tóng)表(biǎo)現的原因(yīn)之(zhī)一(yī)。比如百度(dù)更喜(xǐ)歡(huān)將搜索詞(cí)完整(zhěng)匹(pǐ)配地(dì)出現(xiàn)在(zài)頁麵上(shàng),也就是說搜索“夠(gòu)戲(xì)博客” 時,這四個(gè)字連續完(wán)整出現更容(róng)易(yì)在(zài)百(bǎi)度獲(huò)得好的排名。Google就與此(cǐ)不(bù)同(tóng),不太(tài)要求完整匹配(pèi)。一些頁(yè)麵(miàn)出(chū)現(xiàn)“夠戲(xì)”和“博(bó)客(kè)”兩個詞,但不必完整匹配 地(dì)出現,“夠戲”出現(xiàn)在前(qián)麵,“博客(kè)”出現在頁(yè)麵的其(qí)他(tā)地(dì)方(fāng),這(zhè)樣(yàng)的(dí)頁麵(miàn)在Google搜(sōu)索(suǒ)“夠戲博客”時,也可以獲(huò)得不(bù)錯(cuò)的排名。
搜索(suǒ)引擎對(duì)頁麵的分(fēn)詞取決於詞(cí)庫(kù)的(dí)規模(mó),準確性和(hé)分詞(cí)算(suàn)法的好壞(huài),而(ér)不(bù)是取(qǔ)決於(yú)頁麵(miàn)本(běn)身如何,所(suǒ)以(yǐ)SEO人員對分詞所(suǒ)能(néng)做(zuò)的很少(shǎo)。唯(wéi)一能(néng)做的是在頁麵(miàn)上(shàng)用某種形 式提(tí)示搜(sōu)索(suǒ)引(yǐn)擎(qíng),某幾(jī)個(gè)字應該被當做一個詞(cí)處理(lǐ),尤其是可能(néng)產生歧義(yì)的時(shí)候,比(bǐ)如在(zài)頁(yè)麵(miàn)標題,h1標(biāo)簽(qiān)及(jí)黑體中出(chū)現關(guān)鍵(jiàn)詞(cí)。如(rú)果頁麵(miàn)是(shì)關(guān)於“和服”的內 容,那麼可以把“和服”這兩(liǎng)個字特(tè)意標(biāo)為黑體。如果頁麵(miàn)是關(guān)於“化妝(zhuāng)和(hé)服裝(zhuāng)”,可以(yǐ)把(bǎ)“服裝(zhuāng)”兩(liǎng)個(gè)字標為(wéi)黑(hēi)體(tǐ)。這(zhè)樣(yàng),搜(sōu)索引(yǐn)擎(qíng)對頁麵進行分析時(shí)就知道(dào)標為 黑體的(dí)應(yīng)該是一個詞(cí)。
3.去(qù)停止(zhǐ)詞
無(wú)論是英(yīng)文還是中文,頁麵內(nèi)容(róng)中都(dū)會有一些(xiē)出(chū)現(xiàn)頻(pín)率(shuài)很 高(gāo),卻對(duì)內容(róng)沒(méi)有任(rèn)何影響(xiǎng)的(dí)詞(cí),如“的”,“地”,“得”之(zhī)類(lèi)的助(zhù)詞,“啊”,“哈(hā)”,“呀(yā)”之類的(dí)感(gǎn)嘆(tàn)詞(cí),“從(cóng)而”,“以(yǐ)”,“卻”之類(lèi)的(dí)副(fù)詞或(huò)介(jiè)詞。 這(zhè)些(xiē)詞(cí)被稱為停止(zhǐ)詞(cí),因(yīn)為它們(mén)對頁麵(miàn)的(dí)主(zhǔ)要意(yì)思(sī)沒什(shí)麼(mó)影響。英(yīng)文(wén)中的(dí)常見(jiàn)停止詞有(yǒu)the,a,an,to,of等(děng)。
搜索引(yǐn)擎(qíng)在索引(yǐn)頁麵(miàn)之前會去掉這(zhè)些停止詞,使索(suǒ)引(yǐn)數據主題更(gēng)為(wéi)突(tū)出(chū),減少無(wú)謂(wèi)的(dí)計算(suàn)量。
4.消除噪聲
絕 大部分頁麵(miàn)上(shàng)還(huán)有一(yī)部分內容對(duì)頁麵主(zhǔ)題也(yě)沒有什(shí)麼貢獻(xiàn),比(bǐ)如(rú)版權聲明文(wén)字,導航條,廣告等(děng)。以常見的博客(kè)導航(háng)為例,幾(jī)乎每(měi)個(gè)博(bó)客(kè)頁麵上(shàng)都會(huì)出現文(wén)章分(fēn)類, 歷史(shǐ)存(cún)檔等(děng)導(dǎo)航(háng)內容,但(dàn)是這些頁(yè)麵(miàn)本身與(yǔ)“分類”,“歷史(shǐ)”這些(xiē)詞(cí)都(dū)沒(méi)有任何關(guān)係。用戶搜索(suǒ)“歷史(shǐ)”,“分(fēn)類(lèi)”這(zhè)些(xiē)關鍵(jiàn)詞時僅(jǐn)僅(jǐn)因為頁麵上有這些(xiē)詞(cí)出(chū)現(xiàn)而(ér) 返(fǎn)回博(bó)客帖(tiè)子是毫無意義的(dí),完(wán)全不相關(guān)。所以這些(xiē)區塊(kuài)都屬(shǔ)於(yú)噪聲,對(duì)頁(yè)麵(miàn)主(zhǔ)題隻能起(qǐ)到(dào)分散作(zuò)用(yòng)。
搜索(suǒ)引擎(qíng)需(xū)要識別並消除這些噪(zào)聲,排名時不使(shǐ)用(yòng)噪聲(shēng)內(nèi)容(róng)。消(xiāo)噪的(dí)基本方(fāng)法(fǎ)是根據HTML標簽(qiān)對(duì)頁(yè)麵(miàn)分塊(kuài),區分(fēn)出(chū)頁頭,導航,正(zhèng)文,頁腳,廣告(gào)等區域,在網站(zhàn)上大量(liáng)重復出現的區塊(kuài)往往屬於噪聲。對頁麵(miàn)進行(háng)消噪(zào)後(hòu),剩下(xià)的(dí)才(cái)是頁麵主體(tǐ)內容。
5.去(qù)重
搜索引(yǐn)擎(qíng)還需要(yào)對頁(yè)麵(miàn)進(jìn)行去(qù)重處理(lǐ)。
同(tóng) 一篇文(wén)章(zhāng)經(jīng)常會重(zhòng)復(fù)出(chū)現在(zài)不(bù)同網站及(jí)同一個(gè)網站(zhàn)的(dí)不(bù)同(tóng)網址(zhǐ)上,搜索引擎(qíng)並不(bù)喜歡這(zhè)種(zhǒng)重(zhòng)復性的內(nèi)容。用戶搜(sōu)索時,如果(guǒ)在前兩頁看到(dào)的都(dū)是來(lái)自不(bù)同(tóng)網(wǎng)站(zhàn)的(dí)同一(yī) 篇文章(zhāng),用戶體(tǐ)驗(yàn)就(jiù)太(tài)差(chà)了(liǎo),雖然(rán)都(dū)是內容(róng)相(xiāng)關的。搜索引擎希(xī)望隻(zhī)返回相同(tóng)文(wén)章中的一(yī)篇,所(suǒ)以(yǐ)在進(jìn)行(háng)索(suǒ)引(yǐn)前還需要識別和刪除重復內容,這(zhè)個過程就稱(chēng)為(wéi)“去 重(zhòng)”。
去重的基(jī)本(běn)方(fāng)法是(shì)對(duì)頁麵特征關(guān)鍵(jiàn)詞(cí)計(jì)算指(zhǐ)紋(wén),也就是說從頁麵(miàn)主(zhǔ)體(tǐ)內容中(zhōng)選(xuǎn)取(qǔ)最有(yǒu)代(dài)表性(xìng)的一部分(fēn)關鍵(jiàn)詞(cí)(經(jīng)常是(shì)出現頻率最高(gāo)的關(guān)鍵(jiàn) 詞),然後計算這些關鍵(jiàn)詞(cí)的(dí)數(shù)字(zì)指紋。這(zhè)裏(lǐ)的關(guān)鍵(jiàn)詞(cí)選取是(shì)在分詞(cí),去停(tíng)止詞,消(xiāo)噪之後。實驗表(biǎo)明,通常(cháng)選取(qǔ)10個(gè)特征(zhēng)關鍵(jiàn)詞就可以(yǐ)達到比(bǐ)較高的計算(suàn)準(zhǔn)確(què) 性(xìng),再(zài)選(xuǎn)取更多詞(cí)對(duì)去(qù)重準確性提高的(dí)貢(gòng)獻也就(jiù)不大(dà)了。
典型的指紋計算(suàn)方(fāng)法如MD5算法(信息摘要算(suàn)法第(dì)五(wǔ)版)。這類指紋算(suàn)法的(dí)特點是(shì),輸入(rù)(特(tè)征關鍵詞)有(yǒu)任(rèn)何(hé)微小(xiǎo)的變化(huà),都會(huì)導致計(jì)算(suàn)出的(dí)指紋有很大(dà)差(chà)距(jù)。
了(liǎo) 解(jiě)了搜索(suǒ)引(yǐn)擎(qíng)的去重算法(fǎ),SEO人員就(jiù)應該知道(dào)簡單地(dì)增加(jiā)“的”,“地(dì)”,“得”,調(tiáo)換段落順(shùn)序(xù)這種所(suǒ)謂(wèi)偽原創,並不能逃過搜索引擎的去(qù)重(zhòng)算法(fǎ),因為這(zhè)樣(yàng) 的操(cāo)作無(wú)法(fǎ)改(gǎi)變文(wén)章的特征(zhēng)關鍵(jiàn)詞(cí)。而(ér)且搜(sōu)索(suǒ)引擎的去重算法很可(kě)能(néng)不止於(yú)頁麵級別(bié),而(ér)是進(jìn)行(háng)到段落(là)級別,混(hùn)合不(bù)同文(wén)章,交叉調(tiáo)換段(duàn)落順(shùn)序也(yě)不能(néng)使轉(zhuǎn)載和(hé)抄(chāo)襲 變成(chéng)原創。
6.正(zhèng)向索引(yǐn)
正向(xiàng)索引(yǐn)也可以簡(jiǎn)稱(chēng)為索引(yǐn)。
經過文(wén)字提(tí)取(qǔ),分(fēn)詞(cí), 消噪(zào),去重(zhòng)後,搜(sōu)索(suǒ)引擎得(dé)到(dào)的(dí)就是獨特的,能反映頁(yè)麵(miàn)主體內容的,以詞(cí)為單位的(dí)內(nèi)容。接(jiē)下(xià)來搜(sōu)索引擎索引(yǐn)程序就(jiù)可以(yǐ)提(tí)取關鍵(jiàn)詞(cí),按照分(fēn)詞(cí)程序劃(huá)分好(hǎo)的詞, 把頁(yè)麵轉換為(wéi)一個(gè)關鍵(jiàn)詞組成(chéng)的集(jí)合,同時記錄(lù)每(měi)一個關(guān)鍵(jiàn)詞(cí)在頁(yè)麵上(shàng)的出現(xiàn)頻率,出(chū)現(xiàn)次數(shù),格式(shì)(如(rú)出現(xiàn)在標題標(biāo)簽,黑體,H標(biāo)簽,錨文字等),位置(如頁 麵(miàn)第一(yī)段文字等)。這(zhè)樣(yàng),每一(yī)個頁麵都可以(yǐ)記(jì)錄為(wéi)一串關(guān)鍵詞(cí)集合,其中(zhōng)每個(gè)關(guān)鍵詞的詞頻(pín),格式,位(wèi)置(zhì)等(děng)權重信(xìn)息(xī)也都記(jì)錄在(zài)案(àn)。
搜索(suǒ)引擎(qíng)索引(yǐn)程序將頁(yè)麵及關鍵詞形(xíng)成詞表(biǎo)結(jié)構存儲(chǔ)進索引(yǐn)庫(kù)。簡化(huà)的(dí)索引詞表(biǎo)形(xíng)式如表2-1所示。
每個文(wén)件(jiàn)都對應一(yī)個文(wén)件(jiàn)ID,文(wén)件內(nèi)容被表示為(wéi)一(yī)串(chuàn)關鍵(jiàn)詞的集(jí)合。實(shí)際(jì)上(shàng)在搜索引(yǐn)擎索引庫中(zhōng),關鍵(jiàn)詞也(yě)已經轉換為關(guān)鍵(jiàn)詞(cí)ID.這樣(yàng)的數據結(jié)構就稱為(wéi)正(zhèng)向(xiàng)索(suǒ)引。
7.倒(dǎo)排索引
正向(xiàng)索(suǒ)引(yǐn)還不(bù)能(néng)直(zhí)接用於排名。假設(shè)用戶(hù)搜(sōu)索(suǒ)關(guān)鍵詞(cí)2,如果(guǒ)隻存(cún)在正向索引,排名(míng)程序(xù)需要(yào)掃(sǎo)描所有索(suǒ)引庫(kù)中的文(wén)件(jiàn),找出(chū)包含(hán)關鍵(jiàn)詞(cí)2的文件,再進行(háng)相關(guān)性(xìng)計(jì)算。這(zhè)樣的(dí)計(jì)算(suàn)量(liáng)無(wú)法(fǎ)滿(mǎn)足實時返回(huí)排名結(jié)果的要求(qiú)。
所以(yǐ)搜索引擎會(huì)將正向(xiàng)索引數據庫重新(xīn)構(gòu)造(zào)為倒(dǎo)排(pái)索引,把文(wén)件(jiàn)對應到關鍵詞(cí)的(dí)映射(shè)轉(zhuǎn)換(huàn)為(wéi)關(guān)鍵詞(cí)到(dào)文件(jiàn)的(dí)映射,如表(biǎo)2-2所示。
在倒(dǎo)排(pái)索引中關(guān)鍵詞是(shì)主(zhǔ)鍵,每個關(guān)鍵詞都對(duì)應著一係(xì)列文件,這些(xiē)文件(jiàn)中都(dū)出現(xiàn)了(liǎo)這(zhè)個(gè)關(guān)鍵詞。這(zhè)樣當用戶搜索(suǒ)某(mǒu)個(gè)關鍵詞時(shí),排(pái)序程(chéng)序(xù)在倒排(pái)索(suǒ)引中定位(wèi)到這(zhè)個關(guān)鍵(jiàn)詞(cí),就可以馬上找(zhǎo)出所有包含(hán)這個(gè)關鍵詞的(dí)文(wén)件。
8.鏈接關係計算(suàn)
鏈接關係計(jì)算也是(shì)預處理中很重要的一(yī)部分。現在(zài)所(suǒ)有(yǒu)的主(zhǔ)流搜(sōu)索(suǒ)引擎排(pái)名因素(sù)中(zhōng)都包含網頁之(zhī)間的(dí)鏈接流(liú)動(dòng)信息。搜(sōu)索(suǒ)引(yǐn)擎在抓取(qǔ)頁麵內(nèi)容後(hòu),必須事前(qián)計算(suàn)出:頁(yè) 麵上(shàng)有哪些鏈接指(zhǐ)向哪些其他(tā)頁(yè)麵,每個頁麵(miàn)有(yǒu)哪些導(dǎo)入(rù)鏈(liàn)接,鏈接(jiē)使用(yòng)了(liǎo)什(shí)麼錨文字(zì),這些復雜的鏈接指(zhǐ)向關係形(xíng)成(chéng)了(liǎo)網站和頁(yè)麵的(dí)鏈(liàn)接(jiē)權(quán)重。
Google PR值就(jiù)是(shì)這種鏈接(jiē)關係的最主要體(tǐ)現(xiàn)之(zhī)一。其他搜(sōu)索引擎也都(dū)進行(háng)類(lèi)似(sì)計(jì)算,雖然它們(mén)並不稱為PR.
由於頁麵和(hé)鏈接數(shù)量巨(jù)大(dà),網上(shàng)的鏈接(jiē)關係(xì)又時(shí)時(shí)處在(zài)更(gēng)新中(zhōng),因(yīn)此鏈接(jiē)關係及PR的(dí)計(jì)算要耗費(fèi)很(hěn)長時間。關於(yú)PR和鏈接(jiē)分析,後麵(miàn)還(huán)有專(zhuān)門的(dí)章(zhāng)節(jié)介紹。
9.特殊(shū)文件處理
除 了(liǎo)HTML文件(jiàn)外,搜(sōu)索引(yǐn)擎(qíng)通(tōng)常(cháng)還能抓取和(hé)索(suǒ)引以文字(zì)為(wéi)基礎的多種文(wén)件類(lèi)型(xíng),如(rú)PDF,Word,WPS,XLS,PPT,TXT文件(jiàn)等。我們在搜(sōu)索結果(guǒ) 中(zhōng)也經常會看到這些文件類(lèi)型。但(dàn)目前的搜(sōu)索(suǒ)引擎(qíng)還(huán)不(bù)能(néng)處(chǔ)理圖(tú)片,視(shì)頻(pín),Flash這(zhè)類非文字(zì)內容,也不(bù)能執(zhí)行(háng)腳(jiǎo)本和(hé)程序(xù)。
雖然搜(sōu)索(suǒ)引擎(qíng)在(zài)識(shí)別圖片及從Flash中(zhōng)提(tí)取文字內(nèi)容方(fāng)麵有些(xiē)進步,不(bù)過距(jù)離直接靠(kào)讀(dú)取(qǔ)圖片(piàn),視頻(pín),Flash內容返(fǎn)回(huí)結(jié)果(guǒ)的(dí)目(mù)標還很遠(yuǎn)。對圖(tú)片(piàn),視頻內容(róng)的(dí)排名還(huán)往往是依(yī)據與之(zhī)相(xiāng)關的(dí)文字(zì)內(nèi)容,詳細(xì)情況(kuàng)可(kě)以參(cān)考(kǎo)後(hòu)麵(miàn)的整合(hé)搜索部(bù)分(fēn)。
排(pái)名
經(jīng)過(guò)搜(sōu)索引擎蜘(zhī)蛛抓取(qǔ)的(dí)界(jiè)麵(miàn),搜(sōu)索引(yǐn)擎(qíng)程序(xù) 計算得到倒排索(suǒ)引後(hòu),收索(suǒ)引擎就準(zhǔn)備(bèi)好可以隨(suí)時(shí)處理用戶搜索了。用戶在(zài)搜索框(kuàng)填(tián)入關鍵字後,排名(míng)程(chéng)序(xù)調(tiáo)用(yòng)索引庫數(shù)據,計算排名顯示(shì)給客戶(hù),排名(míng)過程是與(yǔ)客戶(hù)直(zhí)接互動的(dí)。
轉載請保留原(yuán)文地(dì)址(zhǐ): https://antelcom.cn/show-551.html

