基于乐观原-对偶方法的多目标安全 LLM 对齐的最后迭代收敛性证明
机器学习
2026-02-26 v1 人工智能
摘要
从人类反馈中进行强化学习(RLHF)在与人类偏好相匹配方面发挥着重要作用。虽然基于期望奖励约束的 RLHF 可形式化为原-对偶优化问题,但标准原-对偶方法仅保证在鞍点问题呈凸凹形式时,以分布式策略收敛。此外,标准原-对偶方法在实际应用中可能在最后迭代下 exhibit 不稳定或发散,尤其是在策略参数化的情况下。本文提出了一个通用的原-对偶框架,用于安全 RLHF,统一了包括安全-RLHF、一次性和多次基于方法在内的广泛算法。基于该框架,我们引入一种乐观原-对偶(Optimistic Primal-Dual, OPD)算法,为 primal 和 dual 变量引入预测更新,以稳定鞍点动力学。我们为所提方法建立了最后迭代收敛保证,涵盖了在分布式空间中的精确策略优化以及在参数化策略下收敛到最优解附近的解,其间隙与近似误差和偏差相关。我们的分析表明,乐观性在缓解受限对齐目标固有的振荡方面发挥关键作用,从而弥合了受限 RL 与实际 RLHF 之间的关键理论差距。
引用
@article{arxiv.2602.22146,
title = {Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual},
author = {Yining Li and Peizhong Ju and Ness Shroff},
journal= {arXiv preprint arXiv:2602.22146},
year = {2026}
}