中文

CRAFT:通过强化学习实现多跳问答中具有答案忠实轨迹的校准推理

计算与语言 2026-03-17 v2 机器学习

摘要

检索增强的大型语言模型,当使用结果级奖励进行优化时,可以在多跳问题上实现强大的答案准确性。然而,在噪声检索下,模型经常遭受“答案正确但推理错误”的失败:它们可能利用虚假捷径或产生与支撑证据关联薄弱的推理轨迹。此外,缺乏结构化的输出控制阻碍了对底层推理质量的可靠审计。为了解决这个问题,我们提出了 CRAFT(具有答案忠实轨迹的校准推理),这是一个用于检索增强型多跳问答响应生成阶段的强化学习框架。CRAFT 训练模型生成具有可配置审计级别(例如,通过选择性保留规划、证据引用或推理步骤)的结构化推理轨迹。训练结合了两种互补的监督形式:确定性奖励强制执行可验证的约束,包括格式合规性、答案正确性和引用集有效性;而基于评判器的奖励通过评估推理一致性和证据基础来审计语义忠实度。实验表明,CRAFT 在多个模型规模上提高了答案准确性和推理忠实度。值得注意的是,基于语义评判器的奖励提高了答案准确性而非损害它,使得 CRAFT (7B) 能够达到与强大的闭源模型相竞争的性能。

关键词

引用

@article{arxiv.2602.01348,
  title  = {CRAFT: Calibrated Reasoning with Answer-Faithful Traces via Reinforcement Learning for Multi-Hop Question Answering},
  author = {Yu Liu and Wenxiao Zhang and Diandian Guo and Cong Cao and Fangfang Yuan and Qiang Sun and Yanbing Liu and Jin B. Hong and Zhiyuan Ma},
  journal= {arXiv preprint arXiv:2602.01348},
  year   = {2026}
}