中文

基于词性的信息检索词项加权

信息检索 2017-04-07 v1

摘要

自动语言处理工具通常向词项分配所谓的权重,对应于词项对信息内容的贡献。传统上,词项权重由词汇统计(例如词频)计算。我们提出一种新型词项权重,其由词性(POS) n-gram 统计计算。所提出的基于 POS 的词项权重表示一个词项总体上的信息量,基于其在语言中通常出现的 POS 上下文。我们通过扩展现有的词项信息度量统计近似,给出了五种基于 POS 词项权重的计算方式。我们将这些基于 POS 的词项权重应用于信息检索,将其集成到文档与查询匹配的模型中。使用两个 TREC 集合与 300 条查询、以 TF-IDF 和 BM25 为基线的实验表明,将我们的基于 POS 词项权重集成到检索中总能带来增益(较基线最高 +33.7%)。使用另一种检索模型为基线(带 Dirichlet 先验平滑的语言模型)与我们表现最佳的基于 POS 词项权重的附加实验显示,在基线的整个平滑范围内检索增益始终且一致地存在。

关键词

引用

@article{arxiv.1704.01617,
  title  = {Part of Speech Based Term Weighting for Information Retrieval},
  author = {Christina Lioma and Roi Blanco},
  journal= {arXiv preprint arXiv:1704.01617},
  year   = {2017}
}