推理还是记忆?强化学习因数据污染而不可靠的结果
机器学习
2025-12-18 v3 人工智能
计算与语言
摘要
大型语言模型中的推理能力一直是核心研究焦点,近期采用强化学习(RL)的研究引入了多种方法,取得显著性能提升,甚至无需外部监督。令人惊讶的是,一些研究甚至表明随机或错误的奖励信号也能提升性能。然而,这些突破主要出现在MATH-500、AMC和AIME等基准测试上的Qwen2.5系列模型,对像Llama这样的模型则寡淫,值得深入调查。在本工作中,我们的经验分析揭示,大规模网络语料的预训练使Qwen2.5易受到广泛使用的基准测试中的数据污染。因此,基于受污染基准测试对Qwen2.5系列的结论可能不可靠。为获得可信赖的评估结果,我们引入了一个生成器,创建任意长度和难度的干净算术问题,称为RandomCalculation。使用这套无泄漏数据集,我们表明,只有准确的奖励信号才能稳定地提升超越基础模型性能边界的数学推理,而随机或错误的奖励则不行。此外,我们进行更细致的分析,以阐明在MATH-500和RandomCalculation基准测试上不同性能背后的因素。因此,我们建议未来的研究在无污染基准测试上评估模型,并在可行时测试各种模型系列,以确保关于RL和相关方法的可信结论。
引用
@article{arxiv.2507.10532,
title = {Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination},
author = {Mingqi Wu and Zhihao Zhang and Qiaole Dong and Zhiheng Xi and Jun Zhao and Senjie Jin and Xiaoran Fan and Yuhao Zhou and Huijie Lv and Ming Zhang and Yanwei Fu and Qin Liu and Songyang Zhang and Qi Zhang},
journal= {arXiv preprint arXiv:2507.10532},
year = {2025}
}
备注
28 pages, AAAI 2026