中文

MASH:通过选择性求助建模回避行为

计算与语言 2026-04-14 v2

摘要

大语言模型无法可靠地识别其参数知识边界,往往会对超出边界的问题产生幻觉答案。本文介绍了 MASH(Modeling Abstention via Selective Help-seeking),一个可从大语言模型中提取回避行为的训练框架。我们的核心思想是,任何外部求助行为(即搜索工具使用)都可作为回避行为的代理,如果外部求助(搜索)得到适当的惩罚,同时又奖励答案准确性。MASH 使用基于强化学习的支付-搜索奖励来实现这一思想。我们在三个知识密集型 QA 数据集上进行实验。我们的结果表明,MASH 在先前高效搜索方法的选择性求助性能方面显著优于它们;在多跳数据集上,它将答案准确率提高了 7.6%。此外,MASH 显示出强大的即插即用回避性能,表现出与需要额外确定模型知识边界才能构建训练数据的先前回避方法相竞争的行为。总体而言,我们表明 MASH 训练有效地将搜索工具的使用与参数知识对齐,这可成功用于做出回避决策和高效搜索工具使用。

关键词

引用

@article{arxiv.2510.01152,
  title  = {MASH: Modeling Abstention via Selective Help-Seeking},
  author = {Mustafa Omer Gul and Claire Cardie and Tanya Goyal},
  journal= {arXiv preprint arXiv:2510.01152},
  year   = {2026}
}

备注

25 pages, with 15 dedicated to citations and appendix. 17 tables and 11 figures. Preprint, under review. Paper updated to reflect new title and results