中文

用于信息检索的两阶段文档长度归一化

信息检索 2015-02-17 v1

摘要

词频归一化的标准方法仅基于文档长度。然而,它未区分冗长性与范围,这两者是决定文档长度的两个主要因素。由于冗长性和范围对词频增加具有大不相同的影响,标准方法容易根据长文档的具体类型遭受惩罚不足或过度。为克服这些问题,本文提出两阶段归一化,通过分别执行冗长性归一化和范围归一化,并采用不同的惩罚函数。在冗长性归一化中,每个文档通过词频除以文档的冗长性进行预归一化。在范围归一化中,以直接方式将现有检索模型应用于预归一化文档,最终引导我们公式化所提出的冗长性归一化(VN)检索模型。在标准TREC集合上的实验结果表明,VN模型相比标准检索模型带来了微小但统计显著的改进。

关键词

引用

@article{arxiv.1502.04331,
  title  = {Two-Stage Document Length Normalization for Information Retrieval},
  author = {Seung-Hoon Na},
  journal= {arXiv preprint arXiv:1502.04331},
  year   = {2015}
}

备注

40 pages (to appear in ACM TOIS)