中文

自回归排序:弥合双编码器与交叉编码器之间的鸿沟

信息检索 2026-02-12 v4 人工智能 机器学习

摘要

大语言模型(LLMs)的成功推动了检索与排序向生成式方法的转变,旨在取代经典的双编码器(DEs)和交叉编码器(CEs)。一个突出的范式是逐点自回归排序(ARR),其中大语言模型逐令牌生成文档标识符(docIDs),以通过束搜索实现排序。ARR 承诺提供比 DE 更强的表达能力,同时避免了 CE 高昂的计算成本。然而,这种表达能力一直缺乏正式的理论基础。此外,标准的下一令牌预测损失与排序无关,并不适合为排序任务微调 LLM。在本文中,我们首先证明了 ARR 的表达能力严格优于 DE。DE 需要嵌入维度随语料库大小线性增长才能实现任意排序,而 ARR 可以用恒定的隐藏维度解决该问题。接着,我们提出了 SToICaL(简单令牌-项校准损失),一种用于 LLM 微调的广义排序感知训练损失。通过使用项级重加权和前缀树边缘化,我们根据真实相关性在有效 docID 令牌上分配概率质量。在 WordNet 和 ESCI 数据集上的实验验证了我们的损失函数能抑制无效 docID 的生成,并显著提升超越 top-1 检索的排序指标。

关键词

引用

@article{arxiv.2601.05588,
  title  = {Autoregressive Ranking: Bridging the Gap Between Dual and Cross Encoders},
  author = {Benjamin Rozonoyer and Chong You and Michael Boratko and Himanshu Jain and Nilesh Gupta and Srinadh Bhojanapalli and Andrew McCallum and Felix Yu},
  journal= {arXiv preprint arXiv:2601.05588},
  year   = {2026}
}

备注

22 pages, 5 figures