中文

测试向量模型加权技术中不同对数底数的影响

信息检索 2023-07-13 v1 人工智能

摘要

信息检索系统根据用户提交的查询检索相关文档。文档最初被索引,并使用称为 TFIDF 的加权技术为文档中的词分配权重,TFIDF 是词频(TF)与逆文档频率(IDF)的乘积。TF 表示某个词在文档中的出现次数。IDF 衡量该词在所有文档中是常见还是罕见。其计算方法是用系统中的文档总数除以包含该词的文档数,然后取该商的对数。默认情况下,我们使用以 10 为底计算对数。在本文中,我们将通过使用从 0.1 到 100.0 的一系列对数底数来计算 IDF,从而测试该加权技术。测试向量模型加权技术的不同对数底数,旨在强调理解系统在不同加权值下性能的重要性。我们使用科学家专门为数据信息检索系统实验而整理的 MED、CRAN、NPL、LISA 和 CISI 测试集的文档。

关键词

引用

@article{arxiv.2307.06213,
  title  = {Testing different Log Bases For Vector Model Weighting Technique},
  author = {Kamel Assaf},
  journal= {arXiv preprint arXiv:2307.06213},
  year   = {2023}
}

备注

15 pages, 7 figures, vector model, logarithms, tfidf