中文

面向神经参数化在线 RLHF 的全局收敛性分析

机器学习 2025-05-27 v2

摘要

强化学习从人类反馈 (RLHF) 在将大型语言模型 (LLM) 对齐人类价值观方面至关重要。RLHF 是一个三阶段过程,包括监督微调 (SFT)、奖励学习和策略学习。虽然存在多种离线和在线对齐 LLM 的方法,但它们常因分布迁移问题而受限。这一问题源于无法准确捕捉奖励学习与策略学习阶段之间的分布相关性。因此,导致各种近似方法,但理论洞见主要局限于表格设置,这在实际中并不适用。理论洞见与实际实现之间的这一差距至关重要。要解决这一差距,需要分析在神经网络参数化设置下,AI 对齐算法的性能。虽然双层公式在解决分布迁移问题方面显示出前景,但其存在超梯度问题,当前方法缺乏高效算法来解决该问题。本文采用 Kwon 等人 (2024) 中所提出的双层公式,并引入“弱梯度支配”假设,在 RLHF 设置下实现收敛,获得样本复杂度为 ϵ72\epsilon^{-\frac{7}{2}}。我们的主要贡献有二:(i) 我们提出一种用于参数化设置下的 AI 对齐双层公式,引入一种一阶方法来解决该问题。(ii) 我们分析所提算法的理论收敛速率并推导出最新的界限。据我们了解,这是首个在神经网络参数化设置下建立 RLHF 框架收敛速率界限和全局最优性的工作。

关键词

引用

@article{arxiv.2410.15610,
  title  = {On The Global Convergence Of Online RLHF With Neural Parametrization},
  author = {Mudit Gaur and Amrit Singh Bedi and Raghu Pasupathy and Vaneet Aggarwal},
  journal= {arXiv preprint arXiv:2410.15610},
  year   = {2025}
}

备注

The updated version of this paper is arXiv:2503.17644