中文

探索大语言模型推理中的自我对弈机制

机器学习 2025-11-03 v1

摘要

近期大型语言模型(LLM)推理领域的进展,由带有可验证奖励的强化学习(RLVR)驱动,启发了自我对弈后训练技术,即通过生成并解决自身问题来提升模型性能。尽管自我对弈在同一领域内及跨领域内均展现出显著的性能提升,但其背后的机制仍鲜有了解。本文通过绝对零理论家(Absolute Zero Reasoner)的视角分析自我对弈的训练动力学,将其与RLVR和监督微调(SFT)进行比较。我们的研究考察了参数更新稀疏性、标记分布熵动力学以及替代性提议奖励函数。我们进一步通过pass@k评估将这些动力学与推理性能联系起来。总体而言,我们的发现阐明了自我对弈与其他后训练策略之间的差异,揭示了其固有的局限性,并指向通过自我对弈提高大语言模型数学推理能力的未来方向。

关键词

引用

@article{arxiv.2510.27072,
  title  = {Towards Understanding Self-play for LLM Reasoning},
  author = {Justin Yang Chae and Md Tanvirul Alam and Nidhi Rastogi},
  journal= {arXiv preprint arXiv:2510.27072},
  year   = {2025}
}