多即是少:DPO 安全对齐中多模型合成偏好数据的陷阱
人工智能
2025-07-29 v3
摘要
将大型语言模型 (LLM) 与人类价值观对齐是后训练中日益关键的一步。直接偏好优化 (DPO) 已成为一种简单而有效的、替代人类反馈强化学习 (RLHF) 的方法。合成偏好数据以其低成本和高质量,通过单模型或多模型生成的偏好数据实现了有效对齐。我们的研究揭示了与 DPO 对齐相关的一个显著的、特定于安全性的现象:尽管多模型生成的数据通过提供多样化的响应提升了在一般任务 (ARC, Hellaswag, MMLU, TruthfulQA, Winogrande) 上的表现,但它也倾向于在训练期间促进奖励黑客行为。当模型遇到越狱提示时,这可能导致高攻击成功率 (ASR)。当使用更强的模型(如 GPT-4o)或同系列中更大的模型来生成被选中的响应,并与目标模型自生成的被拒绝响应配对时,该问题尤为突出,导致安全性结果大幅恶化。此外,在安全性方面,仅使用自生成的响应(单模型生成)来构成选中与被拒绝对,其表现显著优于纳入更强模型响应的配置——无论这些响应是直接用作选中数据,还是作为多模型响应池的一部分。我们证明,多模型偏好数据在选中与被拒绝响应之间表现出高度的线性可分性,这使得模型能够利用表面线索,而非内化稳健的安全约束。我们在 Llama、Mistral 和 Qwen 系列的模型上进行的实验一致验证了这些发现。
引用
@article{arxiv.2504.02193,
title = {More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment},
author = {Yifan Wang and Runjin Chen and Bolian Li and David Cho and Yihe Deng and Ruqi Zhang and Tianlong Chen and Zhangyang Wang and Ananth Grama and Junyuan Hong},
journal= {arXiv preprint arXiv:2504.02193},
year = {2025}
}
备注
This version includes updated results and expanded discussion