关于 RLHF 通用性的理论理解
机器学习
2026-01-26 v1
摘要
强化学习人类反馈(RLHF)及其变体方法已成为对齐大型语言模型与人类意图的主导方法。尽管方法在实际应用中效果显著,但在高维环境下的理论通用性仍待探索。为此,我们在线性奖励模型下,基于算法稳定性框架构建了 LLMs 的 RLHF 通用性理论。与基于奖励模型最大似然估计一致性的现有工作不同,本文的分析基于端到端学习框架,与实际应用相符。具体地,我们在关键特征覆盖条件下,证明了策略模型的经验最优解具有 阶的通用性界限。此外,结果可推广至由梯度-based 学习算法获得的参数,即梯度上升(GA)和随机梯度上升(SGA)。因此,我们认为本文的结果为 RLHF 后 LLMs 实际观察到的通用性提供了新的理论依据。
引用
@article{arxiv.2601.16403,
title = {Towards a Theoretical Understanding to the Generalization of RLHF},
author = {Zhaochun Li and Mingyang Yi and Yue Wang and Shisheng Cui and Yong Liu},
journal= {arXiv preprint arXiv:2601.16403},
year = {2026}
}
备注
31 pages, 6 figures