中文

自博弈微调将弱语言模型转化为强语言模型

机器学习 2024-06-18 v3 人工智能 计算与语言 机器学习

摘要

利用监督微调(SFT)中的人工标注数据是推动大型语言模型(LLM)发展的关键。在本文中,我们探讨了无需获取额外人工标注数据即可从弱 LLM 培育出强 LLM 的前景。我们提出了一种名为自博弈微调(SPIN)的新微调方法,该方法始于一个经过监督微调的模型。SPIN 的核心在于一种自博弈机制,即 LLM 通过与自身的实例进行博弈来完善其能力。更具体地说,LLM 从其先前的迭代中生成自己的训练数据,并通过区分这些自生成的响应与人工标注数据获得的响应来优化其策略。我们的方法逐步将 LLM 从初级模型提升为强大模型,充分释放了用于 SFT 的人工标注演示数据的全部潜力。理论上,我们证明了仅当 LLM 策略与目标数据分布对齐时,才能实现我们方法训练目标函数的全局最优解。实证方面,我们在多个基准数据集上评估了我们的方法,包括 HuggingFace Open LLM Leaderboard、MT-Bench 以及来自 Big-Bench 的数据集。结果表明,SPIN 能显著提升 LLM 在各种基准测试中的性能,甚至优于通过直接偏好优化(DPO)并辅以额外 GPT-4 偏好数据训练的模型。这揭示了自博弈的前景,使得 LLM 无需专家对手即可实现人类水平的性能。代码可在 https://github.com/uclaml/SPIN 获取。

关键词

引用

@article{arxiv.2401.01335,
  title  = {Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models},
  author = {Zixiang Chen and Yihe Deng and Huizhuo Yuan and Kaixuan Ji and Quanquan Gu},
  journal= {arXiv preprint arXiv:2401.01335},
  year   = {2024}
}

备注

22 pages, 6 figures, 7 tables. In ICML 2024