中文

基于自适应多轮 CUR 分解的跨编码器高效 k-NN 搜索

信息检索 2023-10-24 v2 计算与语言 机器学习

摘要

跨编码器模型联合编码并为查询-条目对打分,直接用于 k 最近邻(k-NN)搜索时成本高昂得令人望而却步。因此,k-NN 搜索通常采用快速近似检索(如使用 BM25 或双编码器向量),随后用跨编码器重排序;然而,检索近似常带来有害的召回遗憾。ANNCUR(Yadav 等,2022)这一近期工作解决了该问题,它仅使用跨编码器,借助相对较少的锚条目与 CUR 矩阵分解实现高效搜索。尽管 ANNCUR 一次性选取锚点倾向于平均近似跨编码器距离,但此举放弃了准确估计靠近查询的条目距离的能力,导致关键端任务——前 k 条目召回——上的遗憾。本文中,我们提出 ADACUR,一种自适应、迭代且高效地最小化实际重要的前 k 近邻近似误差的方法。它通过利用迄今可用锚点迭代执行 k-NN 搜索,再将这些检索到的近邻加入下一轮锚点集来实现。实证上,在多个数据集上,与先前传统及前沿方法(如 ANNCUR 与基于双编码器的检索-重排序)相比,我们提出的 ADACUR 在重要的 k = 1 设定下持续将召回误差降低多达 70%,同时计算开销不高于其竞争者。

关键词

引用

@article{arxiv.2305.02996,
  title  = {Efficient k-NN Search with Cross-Encoders using Adaptive Multi-Round CUR Decomposition},
  author = {Nishant Yadav and Nicholas Monath and Manzil Zaheer and Andrew McCallum},
  journal= {arXiv preprint arXiv:2305.02996},
  year   = {2023}
}

备注

Findings of EMNLP 2023