国产麻豆一区二区精彩视频-国产麻豆一区精品视频-国产麻豆一区在线-国产毛a片久久久久无码-国产毛片av一区二区三区网站-国产毛片精品av一区二区

TF-IDF算法及其對關鍵詞布局方面的權重分布

2014/6/26 14:16:39   閱讀:10423    發布者:10423
概念
TF-IDF(term frequency–inverse document frequency)是一種用于資訊檢索與資訊探勘的常用加權技術。TF-IDF是一種統計方法,用以評估一字詞對于一個文件集或一個語料庫中的其中一份文件的重要程度。字詞的重要性隨著它在文件中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。TF-IDF加權的各種形式常被搜尋引擎應用,作為文件與用戶查詢之間相關程度的度量或評級。除了TF-IDF以外,因特網上的搜尋引擎還會使用基于連結分析的評級方法,以確定文件在搜尋結果中出現的順序。

原理
在一份給定的文件里,詞頻 (term frequency, TF) 指的是某一個給定的詞語在該文件中出現的次數。這個數字通常會被歸一化(分子一般小于分母 區別于IDF),以防止它偏向長的文件。(同一個詞語在長文件里可能會比短文件有更高的詞頻,而不管該詞語重要與否。)
逆向文件頻率 (inverse document frequency, IDF) 是一個詞語普遍重要性的度量。某一特定詞語的IDF,可以由總文件數目除以包含該詞語之文件的數目,再將得到的商取對數得到。
某一特定文件內的高詞語頻率,以及該詞語在整個文件集合中的低文件頻率,可以產生出高權重的TF-IDF。因此,TF-IDF傾向于過濾掉常見的詞語,保留重要的詞語。
TFIDF的主要思想是:如果某個詞或短語在一篇文章中出現的頻率TF高,并且在其他文章中很少出現,則認為此詞或者短語具有很好的類別區分能力,適合用來分類。TFIDF實際上是:TF * IDF,TF詞頻(Term Frequency),IDF反文檔頻率(Inverse Document Frequency)。TF表示詞條在文檔d中出現的頻率(另一說:TF詞頻(Term Frequency)指的是某一個給定的詞語在該文件中出現的次數)。IDF的主要思想是:如果包含詞條t的文檔越少,也就是n越小,IDF越大,則說明詞條t具有很好的類別區分能力。如果某一類文檔C中包含詞條t的文檔數為m,而其它類包含t的文檔總數為k,顯然所有包含t的文檔數n=m+k,當m大的時候,n也大,按照IDF公式得到的IDF的值會小,就說明該詞條t類別區分能力不強。(另一說:IDF反文檔頻率(Inverse Document Frequency)是指果包含詞條的文檔越少,IDF越大,則說明詞條具有很好的類別區分能力。)但是實際上,如果一個詞條在一個類的文檔中頻繁出現,則說明該詞條能夠很好代表這個類的文本的特征,這樣的詞條應該給它們賦予較高的權重,并選來作為該類文本的特征詞以區別與其它類文檔。這就是IDF的不足之處.
在一份給定的文件里,詞頻(term frequency,TF)指的是某一個給定的詞語在該文件中出現的頻率。這個數字是對詞數(term count)的歸一化,以防止它偏向長的文件。(同一個詞語在長文件里可能會比短文件有更高的詞數,而不管該詞語重要與否。)對于在某一特定文件里的詞語
主站蜘蛛池模板: 激情男女在床做爰视频在线观看 | 日本高清视频wwww色 | 毛片无码免费无码播放 | 国产精品久久久久久久久久久免费看 | 国产免费自拍视频 | 99久久久国产精品免费蜜臀 | 欧美精品18videosex性俄罗斯 | 人妻少妇一区二区三区 | 少妇被躁到高潮A片免费 | 午夜婷婷精品午夜无码A片影院 | 国产精品熟妇一区二区三区四区 | 亚洲精品无码久久久久去q 亚洲精品无码久久久影院相关影片 | 蜜臀av在线播放一区二区三区 | 丰满人妻熟妇乱又伦精品 | 天堂中文8资源在线8 | 特黄特色大片免费播放路01 | 亚洲男人第一av网站 | 婷婷色综合网 | 国产满18av精品免费观看视频 | 四虎影视永久免费观看 | 天天做天天添婷婷我也去 | 成人国产精品免费视频不卡 | 亚洲美女精品 | 国产精品婷婷久久爽一下 | 麻麻张开腿让我爽了一夜 | 国产亚洲精品福利视频 | 人妻无码久久久久久久久久久 | 无码激情做A爰片毛片A片小说 | 新婚人妻不戴套国产精品 | 日本国产成人精品视频 | 国产精品欧美久久久久天天影视 | 婷婷影音| 国产精品自产拍在线观看 | 看一级毛片| 污视频在线观看免费 | 天天想夜夜操 | 欧美人妻精品一区二区三区 | 日本成熟老妇xxxx | 日本激情在线视频 | а天堂中文最新一区二区三区 | 欧洲另类一二三四区 |