RLSR:基于自奖励的强化学习
机器学习
2025-08-08 v2 人工智能
摘要
大型语言模型能够生成解决复杂问题的方案,但通常需要可验证的奖励信号进行训练,这类奖励成本高昂且在许多领域难以实现。我们展示了语言模型可以通过自我判断而无需参考解答实现有效的自我改进,利用生成与验证过程之间的内在不对称性。我们的实验表明,在无真实答案的情况下,模型能够提供可靠的奖励信号,从而在可验证奖励难以实现的领域实现强化学习。通过在Countdown谜题和积分问题中实现自我判断,我们在没有真实答案解答的情况下获得了相当于形式化验证的性能。最值得注意的是,使用自奖励训练的 Qwen 2.5 7B DeepSeek Distilled 版本已被资格参加 prestigious 的 MIT Integration Bee 竞赛,体现了通过自监督改进的性能提升。当结合合成问题生成时,我们建立了一个完整的自我改进循环,模型能够生成练习问题、解答并自行评估性能,而无需任何外部验证。我们的发现表明,LLM 评判器能够为训练提供有效的奖励信号,解锁了大量此前因奖励工程限制的领域中的强化学习。本工作标志着自主 AI 系统通过自我导向学习而非人类引导训练持续改进的重要一步,potentially 加速了稀缺训练数据或评估复杂的领域中的进展。
引用
@article{arxiv.2505.08827,
title = {RLSR: Reinforcement Learning from Self Reward},
author = {Toby Simonds and Kevin Lopez and Akira Yoshiyama and Dominique Garmier},
journal= {arXiv preprint arXiv:2505.08827},
year = {2025}
}