SafeDPO:一种增强安全性的直接偏好优化简单方法
机器学习
2026-03-05 v2 人工智能
摘要
随着大型语言模型(LLM)越来越多地部署于现实应用中,平衡有用性与安全性已成为一个核心挑战。一种自然的方法是将安全约束纳入基于人类反馈的强化学习(RLHF)中,近期研究已显示出可喜的进展。然而,这些方法通常依赖辅助网络或多阶段流水线,从而增加了复杂性。在本工作中,我们重新审视了原始的安全对齐目标,并证明在温和的假设下,它存在一个闭式最优策略。我们进一步推导出一个可证明等价且易于处理的目标,从而能够进行直接优化。基于这一洞察,我们提出了SafeDPO,这是一种轻量级方法,它保留了底层安全约束目标的最优解,同时仅需一个额外的超参数,并对现有的基于偏好的训练方法进行最小限度的修改。SafeDPO消除了对奖励模型、成本模型和在线采样的需求,仅依赖偏好数据和安全指标。尽管方法简单,但与现有的安全对齐方法相比,SafeDPO在安全-有用性权衡方面取得了有竞争力的表现。在PKU-SafeRLHF-30K基准上的实验表明,SafeDPO在保持有竞争力的有用性的同时,显著提升了安全性。消融研究进一步表明,额外的超参数提供了一种灵活的机制,可以在保持理论最优性的同时增强安全性,并证实SafeDPO能够可靠地扩展到高达13B参数的LLM。总体而言,我们的结果凸显出,一个简单的、理论驱动的目标可以在实践中为安全对齐提供一种轻量级且有效的解决方案。
引用
@article{arxiv.2505.20065,
title = {SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety},
author = {Geon-Hyeong Kim and Yu Jin Kim and Byoungjip Kim and Honglak Lee and Kyunghoon Bae and Youngsoo Jang and Moontae Lee},
journal= {arXiv preprint arXiv:2505.20065},
year = {2026}
}
备注
40 pages