一种用于改进信息检索的波利亚瓮文档语言模型
信息检索
2015-03-09 v2
摘要
多项式语言模型十多年来一直是最有效的检索模型之一。然而,多项式分布并未对与词项依赖性相关的一个重要语言现象进行建模,即词项在文档内自我重复的倾向(即词突发性)。在本文中,我们将文档生成建模为一个带强化的随机过程(多元波利亚过程),并开发了一个直接捕捉词突发性的狄利克雷复合多项式语言模型。我们证明,新的强化语言模型可以像当前检索模型一样高效计算,并且通过在大量TREC数据集上的实验表明,该模型在多项标准有效性指标上显著优于最先进的语言模型。实验还表明,所提出模型中的调节参数比多项式语言模型中的更稳健。此外,我们为冗余度假说推导了一个约束条件,并证明所提出的模型满足该约束。最后,我们证明新的语言模型本质上引入了一个与idf密切相关的度量,这为在tf-idf类方案中组合词项和文档事件空间提供了理论依据。
引用
@article{arxiv.1502.00804,
title = {A Polya Urn Document Language Model for Improved Information Retrieval},
author = {Ronan Cummins and Jiaul Hoque Paik and Yuanhua Lv},
journal= {arXiv preprint arXiv:1502.00804},
year = {2015}
}
备注
37 page journal submission (accepted for publication in TOIS)