面向检索增强语言模型的基于共享上下文归因的实用驱动检索器训练
计算与语言
2026-02-03 v2
摘要
检索增强语言模型因提供外部知识的检索器而在任务性能上取得显著提升。然而,这一检索器主要关注语义相关性,可能并不总是对生成任务有效。因此,实用驱动检索已成为一个有前景的研究方向,优先考虑为下游任务提供有效益益的段落。然而,由于对实用性的理解不足,准确捕捉段落实用性仍未探索。本文提出SCARLet框架,用于训练RALMs中的实用驱动检索器,包含两个关键因素:多任务泛化与段落间相互作用。首先,SCARLet构建共享上下文,对各种任务的训练数据进行合成。这有助于减轻上下文差异导致的语义偏见,使检索器专注于学习任务特定的实用性并实现跨任务泛化。接着,SCARLet采用扰动基的方法估计共享上下文中各段落的实用性,该方法反映了段落之间的相互作用,提供更准确的反馈。我们在十个数据集上进行评估,涵盖各种任务,包括同一领域和不同领域的数据,结果表明,SCARLet训练的检索器在提升RALMs整体性能方面始终具有优势。
引用
@article{arxiv.2504.00573,
title = {Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Models},
author = {Yilong Xu and Jinhua Gao and Xiaoming Yu and Yuanhai Xue and Baolong Bi and Huawei Shen and Xueqi Cheng},
journal= {arXiv preprint arXiv:2504.00573},
year = {2026}
}
备注
EMNLP 2025 Main Conference (Long paper)