2019-11-26
1、爬行和抓取
搜索引擎派出一個能夠在網(wǎng)上發(fā)現(xiàn)新網(wǎng)頁并抓取文件的程序,這個程序通常被稱為蜘蛛或機器人。搜索引擎蜘蛛從數(shù)據(jù)庫中已知的網(wǎng)頁開始出發(fā),就像正常用戶的瀏覽器一樣訪問這些網(wǎng)頁并抓取文件。
并且搜索引擎蜘蛛會跟蹤網(wǎng)頁上的鏈接,訪問更多網(wǎng)頁,這個過程就叫爬行。當通過鏈接發(fā)現(xiàn)有新的網(wǎng)址時,蜘蛛將把新網(wǎng)址記錄入數(shù)據(jù)庫等待抓取。跟蹤網(wǎng)頁鏈接是搜索引擎蜘蛛發(fā)現(xiàn)新網(wǎng)址的最基本方法,所以反向鏈接成為搜索引擎優(yōu)化的最基本因素之一。沒有反向鏈接,搜索引擎連頁面都發(fā)現(xiàn)不了,就更談不上排名了。
搜索引擎蜘蛛抓取的頁面文件與用戶瀏覽器得到的完全一樣,抓取的文件存入數(shù)據(jù)庫。
2、索引
搜索引擎索引程序把蜘蛛抓取的網(wǎng)頁文件分解、分析,并以巨大表格的形式存入數(shù)據(jù)庫,這個過程就是索引。在索引數(shù)據(jù)庫中,網(wǎng)頁文字內(nèi)容,關(guān)鍵詞出現(xiàn)的位置、字體、顏色、加粗、斜體等相關(guān)信息都有相應記錄。
3、搜索詞處理
用戶在搜索引擎界面輸入關(guān)鍵詞,單擊“搜索”按鈕后,搜索引擎程序即對輸入的搜索詞進行處理,如中文特有的分詞處理,對關(guān)鍵詞詞序的分別,去除停止詞,判斷是否需要啟動整合搜索,判斷是否有拼寫錯誤或錯別字等情況。搜索詞的處理必須十分快速。
4、排序
對搜索詞進行處理后,搜索引擎排序程序開始工作,從索引數(shù)據(jù)庫中找出所有包含搜索詞的網(wǎng)頁,并且根據(jù)排名計算法計算出哪些網(wǎng)頁應該排在前面,然后按一定格式返回“搜索”頁面。
排序過程雖然在一兩秒之內(nèi)就完成返回用戶所要的搜索結(jié)果,實際上這是一個非常復雜的過程。排名算法需要實時從索引數(shù)據(jù)庫中找出所有相關(guān)頁面,實時計算相關(guān)性,加入過濾算法,其復雜程度是外人無法想象的。搜索引擎是當今規(guī)模最大、最復雜的計算系統(tǒng)之一。
2019-11-22
2019-11-23
2019-11-23
2019-11-23
2019-11-23
2019-11-23
2019-11-26
2019-11-26
2019-11-26
2019-11-26
2019-11-26
2019-11-26
2019-11-26
2019-11-26
2019-11-26
2019-12-23