信任但验证:基于自验证的强化学习方法与可验证奖励
人工智能
2025-05-20 v1 计算与语言
摘要
大型语言模型(LLM)在复杂推理方面展现出巨大前景,可验证奖励强化学习(RLVR)是其关键增强策略。然而,一个普遍问题是"浅层自反思",即模型无法稳健地验证自身输出。我们引入RISE(通过自验证强化推理),一种旨在解决此问题的新颖在线强化学习框架。RISE显式且同时训练LLM在单一集成的强化学习过程中提升其问题求解与自验证能力。核心机制利用来自结果验证器的可验证奖励,为解生成与自验证任务提供即时反馈。在每次迭代中,模型生成解,然后批判性地评估其自身在策略上生成的解,两条轨迹均贡献于策略更新。在多样化数学推理基准上的大量实验表明,RISE持续提升模型的问题求解准确率,同时培养强大的自验证能力。我们的分析突出了在线验证的优势和增加验证计算量的益处。此外,RISE模型在推理过程中表现出更频繁且更准确的自验证行为。这些优势进一步确立了RISE作为开发更稳健和自感知推理器的灵活有效路径。
引用
@article{arxiv.2505.13445,
title = {Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards},
author = {Xiaoyuan Liu and Tian Liang and Zhiwei He and Jiahao Xu and Wenxuan Wang and Pinjia He and Zhaopeng Tu and Haitao Mi and Dong Yu},
journal= {arXiv preprint arXiv:2505.13445},
year = {2025}
}
备注
code available at https://github.com/xyliu-cs/RISE