搜(sōu)索引擎(qíng),通常指(zhǐ)的是(shì)收(shōu)集了(liǎo)因特網上幾千萬到幾(jī)十(shí)億個網(wǎng)頁並對網頁中的每一個詞(即關(guān)鍵(jiàn)詞(cí))進行索引,建(jiàn)立(lì)索引數據(jù)庫的(dí)全文搜索引(yǐn)擎。當用戶(hù)查找某個關(guān)鍵詞的時(shí)候,所有在(zài)頁麵內(nèi)容中(zhōng)包含(hán)了(liǎo)該關(guān)鍵詞(cí)的(dí)網(wǎng)頁都(dū)將作為搜(sōu)索結(jié)果被搜出來(lái)。在(zài)經過復雜的算法進行(háng)排序後(hòu),這些結(jié)果(guǒ)將(jiāng)按照(zhào)與搜索關鍵(jiàn)詞的相(xiāng)關度高低,依次排(pái)列。根據自己(jǐ)的優化程(chéng)度,獲得相(xiāng)應(yīng)的名次。
原理概(gài)述(shù)
在搜(sōu)索引擎的後(hòu)台(tái),有一(yī)些用於搜(sōu)集(jí)網頁(yè)信息的(dí)程序。所(suǒ)收集(jí)的(dí)信息(xī)一般(bān)是能(néng)表(biǎo)明網站內容(róng)(包(bāo)括(kuò)網(wǎng)頁本身,網(wǎng)頁的URL地(dì)址,構成網頁的(dí)代碼以及(jí)進出網(wǎng)頁的連(lián)接(jiē))的關(guān)鍵(jiàn)詞(cí)或(huò)者短語。接著將這(zhè)些(xiē)信息的(dí)索引存放到數據庫中。

搜索引擎(qíng)的(dí)係(xì)統架構和(hé)運(yùn)行方(fāng)式吸收(shōu)了信(xìn)息(xī)檢索係(xì)統(tǒng)設(shè)計(jì)中許(xǔ)多(duō)有(yǒu)價值的經(jīng)驗(yàn),也針(zhēn)對萬(wàn)維網(wǎng)數據和用(yòng)戶的特點進行(háng)了(liǎo)許多修(xiū)改(gǎi),如(rú)右(yòu)圖所示的搜索(suǒ)引(yǐn)擎係統架(jià)構。其核心的文(wén)檔(dàng)處理(lǐ)和查(chá)詢(xún)處(chǔ)理(lǐ)過程(chéng)與(yǔ)傳(chuán)統(tǒng)信息檢(jiǎn)索係(xì)統(tǒng)的運(yùn)行(háng)原理基本類似(sì),但其(qí)所(suǒ)處理的數(shù)據(jù)對象即(jí)萬(wàn)維(wéi)網(wǎng)數據(jù)的(dí)繁(fán)雜特性決(jué)定(dìng)了搜(sōu)索(suǒ)引擎係(xì)統(tǒng)必(bì)須進行係統結構的調整,以(yǐ)適應處理數據(jù)和用(yòng)戶查詢(xún)的需要(yào)。
工作原理

爬(pá)行和抓取(qǔ)
搜(sōu)索引(yǐn)擎派(pài)出一個(gè)能夠(gòu)在網上(shàng)發現(xiàn)新(xīn)網頁(yè)並抓(zhuā)文件(jiàn)的程序,這個程(chéng)序通常(cháng)稱之為(wéi)蜘蛛(Spider)。搜(sōu)索(suǒ)引(yǐn)擎從已知(zhī)的數(shù)據庫出(chū)發,就像(xiàng)正常用戶(hù)的(dí)瀏(liú)覽(lǎn)器(qì)一樣(yàng)訪問這些網(wǎng)頁並(bìng)抓取(qǔ)文件。搜索(suǒ)引擎(qíng)通(tōng)過(guò)這些爬蟲去爬互(hù)聯網上的外鏈,從這個(gè)網站爬到另一(yī)個(gè)網站,去跟蹤(zōng)網(wǎng)頁(yè)中(zhōng)的(dí)鏈接,訪問更多(duō)的網(wǎng)頁,這個過程就叫爬(pá)行(háng)。這些(xiē)新的(dí)網(wǎng)址會被存入數據(jù)庫等待搜索。所以(yǐ)跟蹤(zōng)網頁(yè)鏈(liàn)接(jiē)是搜索(suǒ)引(yǐn)擎蜘(zhī)蛛(Spider)發(fā)現新(xīn)網(wǎng)址的最(zuì)基本(běn)的方法,所以(yǐ)反向鏈接成為(wéi)搜(sōu)索(suǒ)引(yǐn)擎優(yōu)化的最(zuì)基(jī)本(běn)因(yīn)素(sù)之一。搜索(suǒ)引(yǐn)擎抓(zhuā)取的頁麵文件(jiàn)與用(yòng)戶瀏(liú)覽器得到的完(wán)全一(yī)樣,抓取的(dí)文(wén)件(jiàn)存入數(shù)據庫。
建(jiàn)立索引(yǐn)
蜘(zhī)蛛抓(zhuā)取的(dí)頁(yè)麵文(wén)件分解,分(fēn)析,並以(yǐ)巨大表格的形(xíng)式存(cún)入(rù)數據庫(kù),這(zhè)個(gè)過程即(jí)是索引(index).在索(suǒ)引數據庫中,網頁文(wén)字內容(róng),關鍵詞出(chū)現的位(wèi)置,字體(tǐ),顏色(sè),加粗,斜體(tǐ)等相(xiāng)關信息都有(yǒu)相應記(jì)錄。
搜(sōu)索(suǒ)詞處理
用戶(hù)在(zài)搜索(suǒ)引(yǐn)擎界(jiè)麵輸入關鍵詞(cí),單擊“搜索”按(àn)鈕後,搜(sōu)索(suǒ)引(yǐn)擎程序即對搜索詞進行處(chǔ)理,如(rú)中文(wén)特有(yǒu)的分(fēn)詞(cí)處(chǔ)理,去除停止詞(cí),判(pàn)斷是(shì)否(fǒu)需要啟(qǐ)動整合(hé)搜(sōu)索(suǒ),判斷(duàn)是(shì)否(fǒu)有拼寫(xiě)錯(cuò)誤或錯別(bié)字等情況。搜(sōu)索詞的(dí)處(chǔ)理必(bì)須(xū)十(shí)分(fēn)快(kuài)速。
排序(xù)
對搜索(suǒ)詞處理後,搜索引(yǐn)擎程(chéng)序便開(kāi)始工作(zuò),從(cóng)索引數(shù)據庫中(zhōng)找出(chū)所(suǒ)有(yǒu)包含搜索詞(cí)的網(wǎng)頁(yè),並(bìng)且根據排名(míng)算法(fǎ)計算出哪(nǎ)些(xiē)網(wǎng)頁應該排在(zài)前麵,然後按照一(yī)定(dìng)格式(shì)返(fǎn)回到“搜(sōu)索”頁(yè)麵。
再好(hǎo)的搜(sōu)索(suǒ)引擎(qíng)也無法(fǎ)與人相(xiāng)比,這(zhè)就是為什(shí)麼網站(zhàn)要(yào)進(jìn)行搜(sōu)索引(yǐn)擎(qíng)優化。沒(méi)有(yǒu)SEO的幫助(zhù),搜索(suǒ)引擎常(cháng)常並(bìng)不能正(zhèng)確的返回(huí)最相(xiāng)關(guān),最權威(wēi),最有(yǒu)用的信息(xī)。
數據結(jié)構
搜索引(yǐn)擎的(dí)核心數(shù)據結構(gòu)為倒(dǎo)排(pái)文件(也稱(chēng)倒排(pái)索(suǒ)引(yǐn)),倒排索引(yǐn)是(shì)指用記(jì)錄的非主(zhǔ)屬(shǔ)性值(也(yě)叫(jiào)副(fù)鍵)來(lái)查(chá)找記(jì)錄而組(zǔ)織的(dí)文件叫倒排文件,即(jí)次索(suǒ)引。倒排文(wén)件(jiàn)中(zhōng)包括(kuò)了所有副(fù)鍵值(zhí),並(bìng)列(liè)出了(liǎo)與之(zhī)有(yǒu)關的(dí)所有記(jì)錄主鍵值,主(zhǔ)要用於(yú)復(fù)雜查(chá)詢。 與(yǔ)傳(chuán)統(tǒng)的SQL查詢不同(tóng),在搜(sōu)索引擎(qíng)收集完數(shù)據(jù)的預處(chǔ)理階(jiē)段,搜(sōu)索引(yǐn)擎往往需(xū)要一(yī)種高(gāo)效(xiào)的數據結(jié)構(gòu)來對外提供檢索服務。而現行(háng)最有(yǒu)效的(dí)數(shù)據結(jié)構就是“倒排文件”。倒(dǎo)排(pái)文件(jiàn)簡(jiǎn)單(dān)一點(diǎn)可(kě)以(yǐ)定義為(wéi)“用(yòng)文(wén)檔的關(guān)鍵(jiàn)詞作為(wéi)索(suǒ)引,文檔(dàng)作為索引(yǐn)目(mù)標的一種(zhǒng)結(jié)構(gòu)(類似於普通書籍中,索引是關(guān)鍵詞,書的(dí)頁麵(miàn)是索引(yǐn)目(mù)標(biāo))。
全(quán)文搜(sōu)索引(yǐn)擎
在(zài)搜索(suǒ)引擎(qíng)分(fēn)類(lèi)部分(fēn)我們提到過全文(wén)搜索引擎(qíng)從網(wǎng)站提取信(xìn)息(xī)建立網(wǎng)頁數據庫(kù)的概(gài)念。搜索引(yǐn)擎的(dí)自動信息搜集(jí)功能分兩種(zhǒng)。一種是(shì)定(dìng)期(qī)搜(sōu)索(suǒ),即每隔(gé)一段時間(jiān)(比如(rú)Google一般是28天),搜(sōu)索引(yǐn)擎(qíng)主(zhǔ)動派出“蜘蛛”程序,對一(yī)定(dìng)IP地(dì)址範圍內的(dí)互聯網(wǎng)站(zhàn)進行(háng)檢索,一旦發現新(xīn)的(dí)網(wǎng)站,它會(huì)自動提取網站的(dí)信(xìn)息(xī)和網址(zhǐ)加入自(zì)己(jǐ)的(dí)數據(jù)庫(kù)。
另一種是(shì)提(tí)交網站搜索,即網(wǎng)站擁有者(zhě)主動(dòng)向(xiàng)搜索(suǒ)引(yǐn)擎(qíng)提(tí)交網址,它(tā)在一定時(shí)間內(2天到(dào)數月不(bù)等)定(dìng)向向你(nǐ)的(dí)網站派(pài)出“蜘(zhī)蛛(zhū)”程序(xù),掃描你(nǐ)的網(wǎng)站並將(jiāng)有關(guān)信息存入數(shù)據庫,以備用(yòng)戶查(chá)詢。由(yóu)於(yú)搜索引(yǐn)擎索(suǒ)引規則發(fā)生(shēng)了很大(dà)變化,主動提(tí)交網址(zhǐ)並不保(bǎo)證你(nǐ)的(dí)網(wǎng)站(zhàn)能進(jìn)入搜(sōu)索(suǒ)引擎數(shù)據(jù)庫,因此目前最(zuì)好的辦(bàn)法是(shì)多獲得一(yī)些(xiē)外(wài)部鏈(liàn)接,讓(ràng)搜索(suǒ)引擎(qíng)有(yǒu)更多機會找(zhǎo)到你(nǐ)並自(zì)動將(jiāng)你(nǐ)的網站收錄(lù)。
當用戶(hù)以(yǐ)關鍵(jiàn)詞查(chá)找信息時(shí),搜索(suǒ)引(yǐn)擎會在數據(jù)庫中(zhōng)進行(háng)搜(sōu)尋(xún),如(rú)果找到(dào)與(yǔ)用戶要(yào)求(qiú)內(nèi)容相(xiāng)符(fú)的網站,便(biàn)采用(yòng)特殊的(dí)算(suàn)法——通(tōng)常(cháng)根據網(wǎng)頁中(zhōng)關鍵詞的匹(pǐ)配程(chéng)度(dù),出現的位(wèi)置(zhì)/頻(pín)次,鏈接質量等(děng)——計算出(chū)各網(wǎng)頁的(dí)相(xiāng)關度及排名等(děng)級(jí),然後根(gēn)據(jù)關(guān)聯(lián)度高低(dī),按(àn)順序將(jiāng)這些網頁鏈接返(fǎn)回給用(yòng)戶。
轉(zhuǎn)載請(qǐng)保(bǎo)留(liú)原文地(dì)址: https://antelcom.cn/show-545.html

