从忠实性到正确性:具备批判性思维的生成奖励模型
计算与语言
2025-10-01 v1 人工智能
机器学习
摘要
通过可验证奖励的强化学习(RLVR),大语言模型在具有易于验证结果的领域(如数学和编码)中取得了实质性进展。然而,当应用于更复杂的任务(如开放域问答)时,RLVR 面临重大挑战,因为正确性难以验证。现实世界知识的微妙和模糊性质使得在这些设置中可靠地评估正确性变得困难,这需要超越单纯逻辑一致性、涵盖对外部知识和内部知识的理解与评估的进一步能力。近期工作主要集中于提高忠实性,定义为与支撑文档的语义对齐,这可能导致模型过度依赖外部来源并削弱其批判性评估的能力。为解决这一问题,我们提出了思考监督奖励模型(Thinking-supervised Reward Model, TRM),它通过句子级思考监督赋予奖励模型批判性思维能力。给定一个查询、答案和支撑文档,TRM 首先评估每个答案句子对支撑文档的忠实性,然后应用推理步骤评估句子级的正确性。通过将奖励建模构建为忠实性、推理和正确性评估的序列,TRM 鼓励模型批判性地评估并利用外部和内部知识。在奖励信号上的实验表明,TRM 大幅提高了对错误句子的识别能力,将 TRM 纳入策略优化在答案正确性和有用性方面均带来了显著提升。
引用
@article{arxiv.2509.25409,
title = {From Faithfulness to Correctness: Generative Reward Models that Think Critically},
author = {Qiyao Ma and Yunsheng Shi and Hongtao Tian and Chao Wang and Weiming Chang and Ting Yao},
journal= {arXiv preprint arXiv:2509.25409},
year = {2025}
}