中文

暂停还是捏造?训练语言模型进行有依据的推理

计算与语言 2026-04-22 v1

摘要

大型语言模型在复杂推理任务上取得了显著进展。然而,当输入不完整时,它们通常会隐式捏造信息,产生自信但不可靠的结论——我们将这种失败模式称为无依据推理。我们认为,该问题并非源于推理能力不足,而是缺乏推理边界意识——即识别有效推理所需的前提何时缺失的能力。为了解决这个问题,我们提出了通过交互式强化学习进行有依据的推理(GRIL),这是一个用于不完整信息下有依据推理的多轮强化学习框架。GRIL 将推理过程分解为两个阶段:澄清与暂停(识别可用信息是否充分),以及有依据的推理(在必要前提确立后执行任务求解)。我们设计了特定阶段的奖励来惩罚幻觉,使模型能够检测信息缺口、主动停止,并在澄清后恢复推理。在 GSM8K-Insufficient 和 MetaMATH-Insufficient 上的实验表明,GRIL 显著提高了前提检测能力(提升达 45%),使任务成功率提高了 30%,同时将平均响应长度减少了 20% 以上。进一步分析证实了模型对嘈杂用户响应的鲁棒性以及对分布外任务的泛化能力。

关键词

引用

@article{arxiv.2604.19656,
  title  = {Pause or Fabricate? Training Language Models for Grounded Reasoning},
  author = {Yiwen Qiu and Linjuan Wu and Yizhou Liu and Yuchen Yan and Jin Ma and Xu Tan and Yao Hu and Daoxin Zhang and Wenqi Zhang and Weiming Lu and Jun Xiao and Yongliang Shen},
  journal= {arXiv preprint arXiv:2604.19656},
  year   = {2026}
}

备注

Code:https://github.com/ZJU-REAL/GRIL