RSPO:大语言模型正则化自我对弈对齐
机器学习
2025-07-09 v2 人工智能
摘要
自我对弈对齐已被证明是微调大语言模型(LLM)的有效方法,将偏好优化问题形式化为两人游戏。然而,针对参考策略的正则化——这是用于缓解过度优化的关键技术——在自我对弈对齐中受到不充分的探讨。为研究不同正则化策略的影响,我们提出了 Regularized Self-Play Policy Optimization(RSPO),这是一个通用且模块化的框架,统一了先前方法,使其能够轻松集成各种正则化器,同时保持收敛到相应正则化游戏的纳什均衡。我们的实证研究涉及超过 120 个微调的 Mistral-7B-Instruct 模型,揭示了前向 KL 散度正则化会减少响应长度,而逆向 KL 散度则显著提升原始胜率。关键的是,RSPO 使用前向和逆向 KL 散度的线性组合正则化,使 AlpacaEval-2 上受控长度胜率从未正则化自我对弈(SPPO)的 28.5% 提升至 35.4%,并在 Arena-Hard、MT-Bench、ArmoRM 等指标和响应多样性方面持续显示出优异性能。凭借简单性、收敛性保证和显著的实证收益,RSPO 为探索语言模型对齐中的正则化自我对弈提供了坚实的基础。
引用
@article{arxiv.2503.00030,
title = {RSPO: Regularized Self-Play Alignment of Large Language Models},
author = {Xiaohang Tang and Sangwoong Yoon and Seongho Son and Huizhuo Yuan and Quanquan Gu and Ilija Bogunovic},
journal= {arXiv preprint arXiv:2503.00030},
year = {2025}
}
备注
Preprint