中文

基于上下文的重要性预测与扩展方法

信息检索 2020-05-22 v2

摘要

在段落检索中,文本上下文稀少情况下的相关性识别是一项主要挑战。我们以一种基于表示的排序方法来解决该问题,该方法:(1)使用上下文语言模型显式建模每个词项的重要性;(2)通过将重要性传播至相似词项来执行段落扩展;(3)将表示锚定于词典,使其可解释。段落表示可在索引时预计算以降低查询时延迟。我们称我们的方法为EPIC(Expansion via Prediction of Importance with Contextualization,基于上下文的重要性预测与扩展)。我们表明EPIC显著优于先前的重要性建模与文档扩展方法。我们还观察到,其性能与当前领先的第一阶段检索方法具有叠加性,进一步缩小了廉价与高成本段落排序方法之间的差距。具体而言,在MS-MARCO段落排序数据集上,EPIC在商用硬件上以78毫秒平均查询延迟取得了0.304的MRR@10。我们还发现,通过对文档表示进行剪枝,延迟进一步降低至68毫秒,而有效性几乎无差异。

关键词

引用

@article{arxiv.2004.14245,
  title  = {Expansion via Prediction of Importance with Contextualization},
  author = {Sean MacAvaney and Franco Maria Nardini and Raffaele Perego and Nicola Tonellotto and Nazli Goharian and Ophir Frieder},
  journal= {arXiv preprint arXiv:2004.14245},
  year   = {2020}
}

备注

Accepted at SIGIR 2020 (short)