中文

解释与预防迭代RLHF中的对齐崩溃

机器学习 2026-05-07 v1 机器学习

摘要

强化学习从人类反馈(RLHF)通常假设奖励模型(RM)是静态的或非策略的。在迭代部署中,策略生成用于重新训练RM的数据,形成反馈回路。基于该交互的Stackelberg博弈形式,我们推导了策略真实优化梯度的解析分解,分为标准策略梯度与捕获策略对RM未来参数影响的参数驾驶项。我们表明,标准的迭代RLHF该丢弃了该驾驶项,导致对齐崩溃:策略系统性地利用RM的盲点,产生低质量高奖励输出,其反馈进一步强化了它所利用的错误。为缓解此问题,我们提出了预见性策略优化(FPO),一种机制设计干预,通过正则化策略对RM更新的参数驾驶效应来恢复遗漏的驾驶项。我们通过可扩展的一阶近似实现FPO,并在受控环境和基于Llama-3.2-1B的LLM对齐管道上 demonstrate了其防止对齐崩溃的能力。

关键词

引用

@article{arxiv.2605.04266,
  title  = {Explaining and Preventing Alignment Collapse in Iterative RLHF},
  author = {Etienne Gauthier and Francis Bach and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2605.04266},
  year   = {2026}
}

备注

Code at: https://github.com/GauthierE/fpo