中文

源自格式与长度的替代信号:无真实答案的数学问题求解强化学习

计算与语言 2026-02-02 v5

摘要

大型语言模型(LLM)在自然语言处理任务中取得了显著成功,其中强化学习(RL)在将其适应于特定应用中发挥了关键作用。然而,在数学问题求解中,由于收集成本高且可用性有限,依赖真实答案带来了重大挑战。本研究探索使用简单的替代信号——格式和长度——来指导 RL 训练。我们发现,训练初期由格式学习主导,仅结构反馈就贡献了大部分性能提升。引入基于长度的奖励通过抑制过长或过短的响应进一步优化输出,使得带有格式-长度信号的 GRPO 方法能够逼近,在某些情况下甚至超越基于真实答案的优化。例如,我们的方法在 7B 基础模型上于 AIME2024 中实现了 40.0% 的准确率,并能在不同模型规模和系列间泛化。除了实际效率外,这些发现为 RL 提供了一个启发性的视角:RL 并非传授新知识,而是主要激活预训练模型中已嵌入的推理能力。这一见解表明,轻量级、标签高效的策略可以补充预训练,以解锁 LLM 在推理密集型任务中的潜在能力。

关键词

引用

@article{arxiv.2505.19439,
  title  = {Surrogate Signals from Format and Length: Reinforcement Learning for Solving Mathematical Problems without Ground Truth Answers},
  author = {Rihui Xin and Han Liu and Zecheng Wang and Yupeng Zhang and Dianbo Sui and Xiaolin Hu and Bingning Wang},
  journal= {arXiv preprint arXiv:2505.19439},
  year   = {2026}
}