SARL:通过奖励推理拓扑实现无标签强化学习
人工智能
2026-05-12 v2
摘要
强化学习对提高大规模推理模型至关重要,但其成功高度依赖可验证的奖励(RLVR),这使得在正确性模糊且无法验证的开放式领域中难以使用。此外,推理轨迹基本保持未受约束,仅优化最终答案会偏好早期开发而非泛化。在本工作中,我们提出是否可以通过教导模型如何思考(推理结构)而非生产什么来改善通用推理能力,将传统 RLVR 扩展到开放式设置。我们引入结构感知强化学习(SARL),一个无标签框架,从中间思考步骤构建每个响应的推理图并奖励其推理拓扑。SARL 将监督从目的地转向路径,鼓励既在局部上连贯又在全局上高效的推理轨迹。在可验证的数学任务上,SARL 在先前无标签 RL 基线之上,甚至超过带有真实监督的 RL 方法,分别在四个数学基准测试中实现 +9.1% 和 +11.6% 的平均提升,在 AIME25 上尤其显著,分别以 +35.5% 和 +44.7%。在非可验证的开放式任务上,SARL 在 WildBench 的五个任务类别中分别实现 +34.6% 和 +30.4% 的平均提升,超越先前无标签 RL 方法和 DPO(后者依赖额外的偏好标签)。除了卓越的性能之外,SARL 表现出显著较低的 KL 散度和更高的策略熵,表明更稳定和更具探索性的训练动力学。代码和数据可在 \href{https://github.com/cacayaya/SARL}{Code Link} 获取。
引用
@article{arxiv.2603.27977,
title = {SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology},
author = {Yifan Wang and Bolian Li and David Cho and Ruqi Zhang and Fanping Sui and Ananth Grama},
journal= {arXiv preprint arXiv:2603.27977},
year = {2026}
}