语言自我对弈:无数据训练方法
人工智能
2025-12-22 v3 计算与语言
计算机科学与博弈论
摘要
大型语言模型(LLM)近年来迅速发展,推动因规模、丰富的高质量训练数据以及强化学习而进步。然而,这一进步面临一个根本性瓶颈:需要不断获取更多数据以供模型继续学习。在本工作中,我们提出一种强化学习方法,通过消除对额外数据依赖来实现模型自身提升。我们的方法基于自我对弈的博弈论框架,其中模型能力被建模为在竞争性游戏中的表现,通过模型对抗自身而产生更强的策略——我们将其称为语言自我对弈(Language Self-Play, LSP)。在Llama-3.2-3B-Instruct模型上进行的指令遵循、数学和编码基准测试实验表明,预训练模型仅通过自我对弈即可有效提升。
引用
@article{arxiv.2509.07414,
title = {Language Self-Play For Data-Free Training},
author = {Jakub Grudzien Kuba and Mengting Gu and Qi Ma and Yuandong Tian and Vijai Mohan and Jason Chen},
journal= {arXiv preprint arXiv:2509.07414},
year = {2025}
}