中文

你的自我对抗算法其实是个对抗性模仿者:从模仿学习视角理解LLM自我对弈

机器学习 2026-02-03 v1

摘要

自我对弈后训练方法已成为微调大型语言模型(LLM)的有效方法,使其能够在没有偏好数据的情况下将弱语言模型变为强语言模型。然而,自我对弈微调的理论基础仍鲜有探索。本文通过将微调过程建模为模型与以模型自身为参数化的正则化隐式奖励者进行的min-max博弈来将自我对弈微调与对抗性模仿学习联系起来。这种视角将自我对弈模仿与通用偏好对齐统一纳入同一框架。在此模型下,我们提出博弈论分析表明自我对弈微调将收敛至其平衡。基于此理论模型,我们提出一种新的自我对弈模仿微调算法,采用 χ2\chi^2-散度变分目标,确保奖励有界并提高稳定性。在各种语言模型微调任务上的实验表明,我们的方法在现有自我对弈方法上 consistently 实现性能提升,验证了我们的理论见解。

关键词

引用

@article{arxiv.2602.01357,
  title  = {Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning},
  author = {Shangzhe Li and Xuchao Zhang and Chetan Bansal and Weitong Zhang},
  journal= {arXiv preprint arXiv:2602.01357},
  year   = {2026}
}

备注

35 pages, 5 tables, 3 figures