中文

关于多阶段密集检索的近似最近邻选择

信息检索 2021-08-27 v1

摘要

密集检索描述了利用近似最近邻(ANN)技术,通过使用诸如 BERT 等上下文化语言模型从文档集合中识别文档的方法,其受欢迎程度日益增加。根据文档和查询是由单个还是多个嵌入表示,出现了两类方法。后者的代表 ColBERT 使用 ANN 索引和近似分数为每个查询嵌入识别一组候选文档,然后使用准确的文档表示对其进行重排。通过这种方式,可以为每个检索大量文档,从而阻碍了该方法的效率。在这项工作中,我们研究了使用 ANN 分数对候选文档进行排序,以减少被完全打分的候选文档数量。在 MSMARCO 段落排序语料库上进行的实验表明,通过使用近似分数将候选集仅截断至 200 篇文档,我们仍然可以获得有效的排序,且有效性没有统计学上的显著差异,同时效率提高了 2 倍。

关键词

引用

@article{arxiv.2108.11480,
  title  = {On Approximate Nearest Neighbour Selection for Multi-Stage Dense Retrieval},
  author = {Craig Macdonald and Nicola Tonellotto},
  journal= {arXiv preprint arXiv:2108.11480},
  year   = {2021}
}