元认知作为奖励:通过知识与调节信号强化LLM推理
计算与语言
2026-05-25 v1 人工智能
摘要
近期的强化学习方法已大幅提升了LLM的推理能力。现有的奖励设计主要遵循两种范式:(1) 带有可验证奖励的强化学习(RLVR)从可执行检查或真实答案中导出结果信号,但对中间推理行为的指导有限。(2) 作为奖励的评分标准通过使用自然语言评分标准来评估推理质量和任务合规性,超越了最终答案检查,但通常需要特定于实例的评分标准以及大量的设计工作。为了解决这些问题,我们引入了元认知作为奖励,一个受元认知启发的强化学习框架,通过两个通用过程维度指导LLM推理:i) 元认知知识,无需手工制作的特定于实例的评分标准即可识别任务相关信息;ii) 元认知调节,规划并调整推理过程,以提供超越最终答案结果的奖励指导。MaR将模型展开构建为显式的元认知组件,并使用任务知识覆盖率、调节保真度和最终答案正确性上的轨迹级奖励对其进行优化。通过这种方式,MaR将奖励反馈扩展到推理轨迹,同时将奖励信号建立在通用元认知维度之上。在22个基准测试上的实验表明,MaR持续提升模型性能,相比基础模型实现高达7.7%的增益,相比原始DAPO实现高达11.0%的增益。值得注意的是,Qwen3.5-9B + MaR缩小了与前沿模型的差距,在总体平均上超越GPT-OSS-120B,并在多个单独基准测试中优于更强的模型。过程级分析进一步表明推理过程质量有实质性改善。MaR也能泛化到域外数据集,其中经MaR训练的模型平均优于其对应的基础模型。
引用
@article{arxiv.2605.23384,
title = {Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals},
author = {Sirui Chen and Lei Xu and Yuying Zhao and Yutian Chen and Yu Wang and Beier Zhu and Hanwang Zhang and Shengjie Zhao and Chaochao Lu},
journal= {arXiv preprint arXiv:2605.23384},
year = {2026}
}