中文

多参考模型 KL 正则化 RLHF:精确解与样本复杂度

机器学习 2025-10-21 v3 机器学习

摘要

当前将大语言模型 (LLM) 与人类反馈对齐的方法主要依赖单一参考模型,这限制了多样性,导致模型过拟合,且未能充分利用大量可用的预训练模型。引入多个参考模型有望通过拓宽视角、减少偏差并利用多样化开源 LLM 的优势来解决这些局限性。然而,将多个参考模型整合到基于人类反馈的强化学习 (RLHF) 框架中带来了重大的理论挑战,其中获得精确解一直是一个悬而未决的问题。本文首次提出了反向 KL 正则化 RLHF 中多参考模型问题的精确解。我们引入了一个全面的理论框架,包括严格的统计分析,并提供了样本复杂度保证。此外,我们将分析扩展到前向 KL 正则化 RLHF,为多参考场景下的样本复杂度需求提供了新的见解。我们的贡献为更先进、更灵活的 LLM 对齐技术奠定了基础,使得能够有效利用多个参考模型。这项工作为开发既在理论上可靠又更适应现代 AI 生态系统挑战的对齐框架铺平了道路。

关键词

引用

@article{arxiv.2502.01203,
  title  = {KL-Regularized RLHF with Multiple Reference Models: Exact Solutions and Sample Complexity},
  author = {Gholamali Aminian and Amir R. Asadi and Idan Shenfeld and Youssef Mroueh},
  journal= {arXiv preprint arXiv:2502.01203},
  year   = {2025}
}

备注

Extra experiments are added in new version