中文

边际基于语言模型对齐的常见陷阱:梯度纠缠

机器学习 2025-04-23 v2 人工智能 计算与语言

摘要

基于人类反馈的强化学习 (RLHF) 已成为语言模型 (LM) 对齐的主要方法。其核心是使用基于边际的损失进行偏好优化,仅通过偏好响应之间的差异来指定理想 LM 行为。在本文中,我们识别了基于边际的方法的常见陷阱——对理想 LM 在偏好响应和反偏好响应上的行为缺乏具体 specification,这导致当边际增加时出现两个意外后果:(1) 反偏好(如不安全)响应的概率可能上升,导致潜在的安全对齐失败。(2) 偏好响应的概率可能下降,即使这些响应是理想的。我们阐明了这些问题行为背后的原因:基于边际的损失将偏好概率的变化与反偏好概率的梯度耦合,反之亦然,常常阻止偏好概率增加而反偏好概率下降,从而导致两者概率同步上升或下降。我们称这种效应为梯度纠缠。形式上,我们推导了一般基于边际的对齐目标下,梯度纠缠何时成为问题的条件:偏好 log 概率梯度与反偏好 log 概率梯度的内积相对于单个梯度范数的比例较大。我们理论上探讨了为何在语言模型对齐中可能出现较大的内积,并经验上验证了我们的发现。我们的框架的经验影响扩展到解释各种偏好优化算法训练动力学的重要差异,并建议潜在的算法设计以缓解基于边际方法的 under-specification 问题,从而提高语言模型对齐。

引用

@article{arxiv.2410.13828,
  title  = {A Common Pitfall of Margin-based Language Model Alignment: Gradient Entanglement},
  author = {Hui Yuan and Yifan Zeng and Yue Wu and Huazheng Wang and Mengdi Wang and Liu Leqi},
  journal= {arXiv preprint arXiv:2410.13828},
  year   = {2025}
}