中文

Veri-R1:通过在线强化学习实现精确可信 claim 验证

计算与语言 2025-10-07 v2

摘要

大语言模型 (LLMs) 的 claim 验证近年来受到关注,因为其强大的推理能力和透明的验证过程较传统仅给出答案的判断更具优势。然而,现有的在线 claim 验证方法——需要迭代证据检索和推理——主要依赖 prompt 工程或预设计的推理工作流程,缺乏统一训练提升必要技能。因此,我们引入 Veri-R1,一个在线强化学习 (RL) 框架,使大语言模型能够与搜索引擎交互并接收显式塑造其规划、检索和推理行为的奖励信号。这种大语言模型与检索系统的动态交互更准确地反映了现实世界的验证场景,促进了全面验证技能的发展。实证结果表明,Veri-R1 在联合准确率上提升最高可达 30%,证据得分翻倍,常常超越其更大规模模型的表现。消融研究进一步揭示奖励组成部分的影响,以及输出 logits 与标签准确率之间的关系。我们的结果突显了在线 RL 对实现精确可信 claim 验证的有效性,为未来研究提供了重要基础。我们发布代码以支持社区在大语言模型赋能的 claim 验证方面的进展。

关键词

引用

@article{arxiv.2510.01932,
  title  = {Veri-R1: Toward Precise and Faithful Claim Verification via Online Reinforcement Learning},
  author = {Qi He and Cheng Qian and Xiusi Chen and Bingxiang He and Yi R. Fung and Heng Ji},
  journal= {arXiv preprint arXiv:2510.01932},
  year   = {2025}
}