中文

语言自我对弈:无数据训练方法

人工智能 2025-12-22 v3 计算与语言 计算机科学与博弈论

摘要

大型语言模型(LLM)近年来迅速发展,推动因规模、丰富的高质量训练数据以及强化学习而进步。然而,这一进步面临一个根本性瓶颈:需要不断获取更多数据以供模型继续学习。在本工作中,我们提出一种强化学习方法,通过消除对额外数据依赖来实现模型自身提升。我们的方法基于自我对弈的博弈论框架,其中模型能力被建模为在竞争性游戏中的表现,通过模型对抗自身而产生更强的策略——我们将其称为语言自我对弈(Language Self-Play, LSP)。在Llama-3.2-3B-Instruct模型上进行的指令遵循、数学和编码基准测试实验表明,预训练模型仅通过自我对弈即可有效提升。

关键词

引用

@article{arxiv.2509.07414,
  title  = {Language Self-Play For Data-Free Training},
  author = {Jakub Grudzien Kuba and Mengting Gu and Qi Ma and Yuandong Tian and Vijai Mohan and Jason Chen},
  journal= {arXiv preprint arXiv:2509.07414},
  year   = {2025}
}