FlipGuard:针对更新回归的偏好对齐防御方法
计算与语言
2024-10-15 v2 人工智能
摘要
近期偏好对齐方面的突破显著提升了大型语言模型生成符合人类偏好和价值观文本的能力。然而,当前的对齐指标通常强调事后整体改进,忽略了一个关键方面:回归,即在更新后对先前正确处理数据的后退。这种潜在问题可能源于对已正确对齐数据进行过度微调,导致过度对齐和退化。为应对这一挑战,我们提出了 FlipGuard 方法,通过受约束的优化方法识别并缓解更新回归。具体而言,FlipGuard 使用定制的奖励特征描述来识别性能下降,同时在训练时战略性地施加约束,以鼓励与事前对齐模型在条件上的一致性。综合实验表明,FlipGuard 有效缓解了更新回归,同时表现出卓越的整体性能,增强了在对齐偏好方面的知识保留能力。
引用
@article{arxiv.2410.00508,
title = {FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization},
author = {Mingye Zhu and Yi Liu and Quan Wang and Junbo Guo and Zhendong Mao},
journal= {arXiv preprint arXiv:2410.00508},
year = {2024}
}
备注
Accepted by EMNLP 2024 Main track