中文

解构长链式思维推理模型:实证研究

机器学习 2025-11-11 v2 计算与语言

摘要

尽管最近在通过扩展强化学习(RL)训练长链式思维推理模型方面取得了进展,但其 underlying 训练动力学仍不完全为人所知,仍存在一些反直觉的行为。本工作聚焦于三个关键方面:(1)我们系统地分析了正负样本在扩展 RL 中的作用,揭示正样本主要促进对训练数据的精确拟合,而负样本显著提升泛化和鲁棒性。有趣的是,尽管正样本在零 RL 设置中对收敛至关重要,但仅训练负样本即可实现强大的推理性能甚至更好的泛化,在 cold-start 场景中效果更佳。(2)我们识别出组相对策略优化中存在大量数据效率不足,其中超过半数的样本 yield zero advantage。为此,我们探索了两种策略,包括相对长度奖励和离线样本注入,以更好地利用这些数据并提升推理效率和能力。(3)我们研究了各种推理模型和基准测试之间的性能不稳定性,将其归因于结果模糊的不确定问题,并演示了贪婪解码会通过翻转响应的正确性来扭曲评估。我们的代码可在 https://github.com/takagi97/Dissect-Long-Reason-Models 查阅。

关键词

引用

@article{arxiv.2506.04913,
  title  = {Dissecting Long-Chain-of-Thought Reasoning Models: An Empirical Study},
  author = {Yongyu Mu and Jiali Zeng and Bei Li and Xinyan Guan and Fandong Meng and Jie Zhou and Tong Xiao and Jingbo Zhu},
  journal= {arXiv preprint arXiv:2506.04913},
  year   = {2025}
}

备注

Working in process