DFR排序的自适应分布扩展
信息检索
2016-09-06 v1
摘要
随机性偏离(Divergence From Randomness, DFR)排序模型假设,信息词项在语料库中的分布与非信息词项不同。不同的统计模型(如泊松分布、几何分布)被用于建模非信息词项的分布,从而产生不同的DFR模型。随后,通过测量某词项分布与非信息词项分布之间的偏离程度来检测信息词项。然而,几乎没有经验证据表明DFR中使用的非信息词项分布确实拟合当前数据集。这在实践中可能导致信息词项与非信息词项之间缺乏良好的区分度,从而损害排序模型的判别能力。我们提出了一种对DFR的新型扩展,该扩展首先检测集合中非信息词项的最佳拟合分布,然后调整排序计算以适应此最佳拟合分布。我们将此模型称为自适应分布排序(Adaptive Distributional Ranking, ADR),因为它将排序调整为适应每次处理的特定数据集的统计特性。在TREC数据上的实验表明,ADR优于DFR模型(及其扩展),且性能与查询似然语言模型(LM)相当。
引用
@article{arxiv.1609.00969,
title = {Adaptive Distributional Extensions to DFR Ranking},
author = {Casper Petersen and Jakob Grue Simonsen and Kalervo Jarvelin and Christina Lioma},
journal= {arXiv preprint arXiv:1609.00969},
year = {2016}
}