<ul id="g60s4"><pre id="g60s4"></pre></ul>
<strong id="g60s4"><nav id="g60s4"></nav></strong>
<ul id="g60s4"></ul>
  • <tr id="g60s4"></tr>
  • 
    
  • 或者

    搜索引擎索引系統概述(一)

    作者:月光邊境 瀏覽:2690 發布時間:2017-04-29
    分享 評論 0

    眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統,以億為單位的網頁庫中查找特定的某些關鍵詞猶如大海里面撈針,也許一定的時間內可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿意的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

      如果能知道用戶查找的關鍵詞(query切詞后)都出現在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:

      (1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記,例如:title、keywords、content、link、anchor、評論、其他非重要區域等等;

      (2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數據:term文本、termid、詞類、詞性等等;

      (3)之前的準備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應用【doc->term】呢?

      上述即是索引系統中的倒排索引過程,是搜索引擎實現毫秒級檢索非常重要的一個環節。

    av国内精品久久久久影院| 99久久99热精品免费观看国产| 亚欧日韩毛片在线看免费网站| 精品久久久久久亚洲综合网| 99任你躁精品视频| 91精品久久久久久无码| 久久ww精品w免费人成| 久久夜色精品国产噜噜亚洲AV| 亚洲国产综合精品中文第一区| 久久精品国产精油按摩| 国产国产精品人在线观看| 亚洲日韩精品无码专区加勒比 | 国产精品三级在线观看无码| 日韩高清在线观看| 国产精品自在在线午夜| 99视频30精品视频在线观看| 国产精品影音先锋| 精品国产精品国产偷麻豆 | 亚洲AV永久无码精品网站在线观看| 国产精品青草久久久久婷婷| 精品亚洲国产成人| 国产精品电影在线观看| 999在线视频精品免费播放观看| 国产精品扒开腿做爽爽爽视频| 亚洲韩国精品无码一区二区三区| 国内大量偷窥精品视频| 日韩放荡少妇无码视频| 国产精品V亚洲精品V日韩精品| 亚洲av无码成人精品国产| 国产精品久线观看视频| 99re5在线精品视频热线| 少妇精品无码一区二区三区| 99精品视频在线在线视频观看| 九九精品99久久久香蕉| 久久久国产精品四虎| 中文字幕亚洲精品无码| 精品久久久久久久免费加勒比| 国产成人精品综合| 精品国产专区91在线尤物| 亚洲AV无码成人精品区狼人影院| 精品丝袜人妻久久久久久|