中文

通过强化学习提升短文本与长文本问答中的可靠性

计算与语言 2025-12-11 v1

摘要

尽管强化学习已在大型语言模型中实现了前所未有的复杂推理能力,但也放大了其迁幻倾向,形成了能力与可靠性之间的关键权衡。本工作通过引入旨在缓解内在与外在迁幻的针对性强化学习框架,应对这一挑战。我们通过将 TriviaQA 的开放式转换构建为新训练集以解决外在迁幻( flawed 内部知识)。同时,我们利用 FineWeb 中的长文本构建事实 grounding reward 方案以解决内在迁幻(对上下文的不忠实)。为进一步提升可靠性,我们的框架明确奖励模型拒绝回答不可回答问题,从而培养关键的谨慎性。广泛实验表明,我们的方法在多样化基准测试上实现显著性能提升,显著降低两种迁幻类型。最终,本研究为解决先进推理与事实可信度之间的关键矛盾提供了实用框架,为更具能力和可靠的大型语言模型之路。

关键词

引用

@article{arxiv.2512.08944,
  title  = {Enhancing Reliability across Short and Long-Form QA via Reinforcement Learning},
  author = {Yudong Wang and Zhe Yang and Wenhan Ma and Zhifang Sui and Liang Zhao},
  journal= {arXiv preprint arXiv:2512.08944},
  year   = {2025}
}