中文

多向量检索作为稀疏对齐

计算与语言 2022-11-03 v1 信息检索

摘要

多向量检索模型在许多信息检索任务上优于单向量双编码器。本文将多向量检索问题视为查询与文档词元之间的稀疏对齐。我们提出 AligneR,一种新颖的多向量检索模型,它学习查询与文档词元之间稀疏化的成对对齐(例如“dog”对“puppy”)以及反映其相对检索重要性的每词元一元显著度。我们表明,控制成对词元对齐的稀疏度常带来显著性能提升。虽然大多数聚焦于文档特定部分的事实型问题需要较少的对齐,而其他需要更广泛理解文档的问题则偏好更多对齐。另一方面,一元显著度决定一个词元是否 ever 需要为检索而与其他词元对齐(例如“kind of currency is used in new zealand”中的“kind”)。通过稀疏化的一元显著度,我们能够剪枝大量查询和文档词元向量并提升多向量检索效率。我们使用熵正则化线性规划学习稀疏一元显著度,其优于其他实现稀疏度的方法。在零样本设置下,AligneR 取得 51.1 分 nDCG@10,在 BEIR 基准的 13 个任务上达到新的仅检索器最先进水平。此外,用少量示例(≤ 8)适配成对对齐进一步将论证检索任务的性能提升高达 15.7 分 nDCG@10。AligneR 的一元显著度帮助我们仅保留 20% 的文档词元表示且性能损失极小。我们进一步表明,我们的模型常产生可解释的对齐,并且当从更大的语言模型初始化时性能显著提升。

关键词

引用

@article{arxiv.2211.01267,
  title  = {Multi-Vector Retrieval as Sparse Alignment},
  author = {Yujie Qian and Jinhyuk Lee and Sai Meher Karthik Duddu and Zhuyun Dai and Siddhartha Brahma and Iftekhar Naim and Tao Lei and Vincent Y. Zhao},
  journal= {arXiv preprint arXiv:2211.01267},
  year   = {2022}
}