中文

切勿重踏同一河流两次:从试错中学习推理

机器学习 2026-04-17 v4

摘要

基于可验证奖励的强化学习 (RLVR) 显著�提升了语言模型 (LM) 的推理能力。然而,现有 RLVR 方法基于模型自身的 on-policy 响应进行训练,受限于模型的初始能力,容易出现探索停滞,即模型未能解决更多训练问题,无法从训练数据中进一步学习。一些方法试图通过利用离-policy 解决方案来解决训练问题,但依赖外部专家指导,在可用性和可扩展性方面受限。本文提出了 LTE (Learning to reason from Trial and Error),一种通过模型自身之前犯下的错误来提示模型的做法,无需任何外部专家指导。实验验证了 LTE 的有效性,该方法在 Qwen3-8B-Base 上的六个数学推理基准测试中,Pass@1 平均提升 5.02,Pass@k 平均提升 9.96,甚至优于需要外部指导的方法。进一步分析确认,LTE 成功缓解了探索停滞,增强了训练期间的剥削和探索。我们的代码已公开于 https://github.com/JamyDon/LTE。

关键词

引用

@article{arxiv.2510.26109,
  title  = {Do Not Step Into the Same River Twice: Learning to Reason from Trial and Error},
  author = {Chenming Tang and Hsiu-Yuan Huang and Weijie Liu and Clive Bai and Saiyong Yang and Yunfang Wu},
  journal= {arXiv preprint arXiv:2510.26109},
  year   = {2026}
}

备注

Accepted to ACL 2026 (main conference)