中文

RESTRAIN:从虚假投票到信号——自驱动 RL 与自惩罚机制

计算与语言 2025-10-03 v1

摘要

利用人类标注数据的强化学习推动了大推理模型中的思维链推理,但这些收益在标注数据方面代价高昂,并且在更难的任务上表现不佳。一个自然的下一步是经验驱动的学习,模型通过适应无标签数据而无需精心策划的标签即可改进。我们引入了 RESTRAIN(REinforcement learning with Self-restraint),一种自惩罚的 RL 框架,将缺少金标准标签转化为有用的学习信号。RESTRAIN 不会过度依赖虚假的多数投票,而是利用模型整个答案分布中的信号:惩罚过度自信的 rollout 和低一致性示例,同时保留有前景的推理链。自惩罚机制可以无缝集成到 GRPO 等策略优化方法中,实现无需监督的持续自我改进。在具有挑战性的推理基准测试上,RESTRAIN 仅使用无标签数据就取得了显著提升。在 Qwen3-4B-Base 和 OctoThinker Hybrid-8B-Base 上,它在 AIME25 上将 Pass@1 提高了最多 +140.7%,在 MMLU_STEM 上提高了 +36.2%,在 GPQA-Diamond 上提高了 +19.6%,接近金标准标签训练的效果,同时不使用任何金标准标签。这些结果表明,RESTRAIN 为在没有金标准标签的情况下实现更强的推理建立了一条可扩展的路径。

关键词

引用

@article{arxiv.2510.02172,
  title  = {RESTRAIN: From Spurious Votes to Signals -- Self-Driven RL with Self-Penalization},
  author = {Zhaoning Yu and Will Su and Leitian Tao and Haozhu Wang and Aashu Singh and Hanchao Yu and Jianyu Wang and Hongyang Gao and Weizhe Yuan and Jason Weston and Ping Yu and Jing Xu},
  journal= {arXiv preprint arXiv:2510.02172},
  year   = {2025}
}