通过自我引导扩展自我博弈
机器学习
2026-04-23 v1
摘要
大语言模型(LLM)自我博弈算法之所以引人注目,是因为原则上没有任何东西限制其学习:一个猜想者模型为求解者创建问题,两者共同进步。然而,在实践中,现有的大语言模型自我博弈方法在大量计算资源下扩展性不佳,反而会遇到学习平台期。我们认为这是因为在长时间训练中,猜想者学会了破解其奖励,崩溃为生成对求解者改进无益的人为复杂问题。为了克服这一点,我们引入了自我引导的自我博弈(SGS),这是一种自我博弈算法,其中语言模型自身引导猜想者远离退化。在SGS中,模型扮演三个角色:求解者、猜想者,以及一个引导者,该引导者根据合成问题与未解决目标问题的相关性以及它们的清晰度和自然度进行评分,为对抗猜想者崩溃提供监督。我们的核心假设是,语言模型可以评估一个子问题是否有助于实现一个目标。我们通过比先前工作显著更长的训练时间以及通过将缩放定律拟合到累积求解率曲线来评估SGS的缩放特性。将SGS应用于Lean4中的形式化定理证明,我们发现它在不到80轮的自我博弈中就超越了我们最强强化学习基线的渐近求解率,并使一个7B参数的模型在200轮自我博弈后,解决的数学问题数量超过了671B参数模型的pass@4。
引用
@article{arxiv.2604.20209,
title = {Scaling Self-Play with Self-Guidance},
author = {Luke Bailey and Kaiyue Wen and Kefan Dong and Tatsunori Hashimoto and Tengyu Ma},
journal= {arXiv preprint arXiv:2604.20209},
year = {2026}
}