中文

论稠密段落检索中的单表示与多表示

信息检索 2021-08-20 v2 计算与语言

摘要

上下文语言模型的出现带来了搜索效果的提升,不仅当应用于对 BM25 等经典加权模型输出进行重排序时,而且当直接用于段落索引和检索(一种称为稠密检索的技术)时也是如此。在神经排序的现有文献中,两个稠密检索族已变得明显:单表示,其中整个段落由单个嵌入表示(通常是 BERT 的 [CLS] 令牌,如最近的 ANCE 方法所例示),或多表示,其中段落中的每个令牌由其自身的嵌入表示(如最近的 ColBERT 方法所例示)。这两族尚未被直接比较。然而,由于稠密检索在未来可能的重要性,清楚理解它们的优缺点至关重要。为此,本文对它们的比较效果进行了直接研究,指出了每种方法相对于彼此以及相对于 BM25 基线表现不足或过度的情形。我们观察到,虽然 ANCE 在响应时间和内存使用方面比 ColBERT 更高效,但多表示在 MAP 和 MRR@10 上统计上比单表示更有效。我们还表明,对于 BM25 最难的查询,以及定义性查询和具有复杂信息需求的查询,多表示比单表示获得更好的改进。

关键词

引用

@article{arxiv.2108.06279,
  title  = {On Single and Multiple Representations in Dense Passage Retrieval},
  author = {Craig Macdonald and Nicola Tonellotto and Iadh Ounis},
  journal= {arXiv preprint arXiv:2108.06279},
  year   = {2021}
}

备注

Published at the 11th Italian Information Retrieval Workshop (IIR 2021)