改进多主题文档的词频归一化及其在语言建模方法中的应用
信息检索
2015-02-10 v1 计算与语言
摘要
词频归一化是一个严重的问题,因为文档长度各不相同。通常,文档变长有两个不同的原因:冗长性和多主题性。首先,冗长性意味着与主题相关的术语反复提及同一主题,使得词频比良好总结的文档增加得更多。其次,多主题性表明文档对多个主题进行了广泛讨论,而非单一主题。尽管这些文档特征应区别处理,但所有先前的词频归一化方法都忽略了这些差异,并使用了仅通过文档长度降低词频的简化长度驱动方法,导致了不合理的惩罚。为解决这一问题,我们提出了一种新型的 TF 归一化方法,属于部分公理化方法。我们首先公式化了检索模型应分别满足的针对具有冗长性和多主题性特征文档的两个形式约束。然后,我们修改了语言建模方法以更好地满足这两个约束,并推导了新型的平滑方法。实验结果表明,所提出的方法显著提高了关键词查询的精度,并大幅改善了冗长查询的平均准确率均值 (MAP)。
引用
@article{arxiv.1502.02277,
title = {Improving Term Frequency Normalization for Multi-topical Documents, and Application to Language Modeling Approaches},
author = {Seung-Hoon Na and In-Su Kang and Jong-Hyeok Lee},
journal= {arXiv preprint arXiv:1502.02277},
year = {2015}
}
备注
8 pages, conference paper, published in ECIR '08