基于自适应多轮 CUR 分解的跨编码器高效 k-NN 搜索
信息检索
2023-10-24 v2 计算与语言
机器学习
摘要
跨编码器模型联合编码并为查询-条目对打分,直接用于 k 最近邻(k-NN)搜索时成本高昂得令人望而却步。因此,k-NN 搜索通常采用快速近似检索(如使用 BM25 或双编码器向量),随后用跨编码器重排序;然而,检索近似常带来有害的召回遗憾。ANNCUR(Yadav 等,2022)这一近期工作解决了该问题,它仅使用跨编码器,借助相对较少的锚条目与 CUR 矩阵分解实现高效搜索。尽管 ANNCUR 一次性选取锚点倾向于平均近似跨编码器距离,但此举放弃了准确估计靠近查询的条目距离的能力,导致关键端任务——前 k 条目召回——上的遗憾。本文中,我们提出 ADACUR,一种自适应、迭代且高效地最小化实际重要的前 k 近邻近似误差的方法。它通过利用迄今可用锚点迭代执行 k-NN 搜索,再将这些检索到的近邻加入下一轮锚点集来实现。实证上,在多个数据集上,与先前传统及前沿方法(如 ANNCUR 与基于双编码器的检索-重排序)相比,我们提出的 ADACUR 在重要的 k = 1 设定下持续将召回误差降低多达 70%,同时计算开销不高于其竞争者。
引用
@article{arxiv.2305.02996,
title = {Efficient k-NN Search with Cross-Encoders using Adaptive Multi-Round CUR Decomposition},
author = {Nishant Yadav and Nicholas Monath and Manzil Zaheer and Andrew McCallum},
journal= {arXiv preprint arXiv:2305.02996},
year = {2023}
}
备注
Findings of EMNLP 2023