中文

通过回归至相对奖励的在线分布鲁棒 LLM 对齐

机器学习 2026-04-20 v2 机器学习

摘要

基于人类反馈的强化学习(RLHF)已成为使大型语言模型(LLM)与人类意图对齐的关键。然而,现有的离线 RLHF 方法存在过度优化问题,即语言模型因过拟合不准确信息并偏离训练期间观察到的偏好行为而退化。分布鲁棒优化(DRO)是一种自然的解决方案,但现有的 DRO-DPO 方法样本效率低、忽略异构偏好,且依赖脆弱的启发式方法。我们引入了 DRO-REBEL,这是一系列基于 type-pp Wasserstein、Kullback-Leibler (KL) 和 χ2\chi^2 歧义集的鲁棒在线 REBEL 更新。强对偶性将每次更新简化为相对奖励回归,在无需 PPO 风格截断或价值网络的情况下保留了 REBEL 的可扩展性。在线性奖励、对数线性策略和标准覆盖条件下,我们证明了参数平方误差的 O~(d/n)\widetilde{O}(\sqrt{d/n}) 界限,其常数比先前的 DRO-DPO 分析更优,并首次给出了在偏好转移下基于 DRO 对齐的参数化 O~(d/n)\widetilde{O}(d/n) 速率,在良性环境下与非鲁棒 RLHF 相匹配。每种散度都产生了一种易于处理的基于 SGD 的算法:Wasserstein 采用梯度正则化,KL 采用重要性加权,χ2\chi^2 采用一维对偶求解。在 Emotion Alignment、ArmoRM 多目标基准和 HH-Alignment 上,DRO-REBEL 在未见过的偏好混合、模型大小和数据集规模上均优于先前的鲁棒与非鲁棒基线。

关键词

引用

@article{arxiv.2509.19104,
  title  = {Online Distributionally Robust LLM Alignment via Regression to Relative Reward},
  author = {Sharan Sahu and Martin T. Wells},
  journal= {arXiv preprint arXiv:2509.19104},
  year   = {2026}
}

备注

70 pages, 7 figures, 1 table