Cat-DPO:基于类别的安全对齐方法
计算与语言
2026-04-22 v2 人工智能
摘要
与人类偏好一致的大型语言模型必须平衡两个竞争目标:既要对合法请求提供有帮助的响应,又要可靠地拒绝有害请求。大多数基于偏好的安全对齐方法会将安全性压缩为单个标量,并统一应用于每一对偏好。结果是,该模型在平均上看起来安全,但在少数有害类别上仍然相对不安全。我们将安全对齐建模为每个类别的受约束优化问题,推导出 Cat-DPO,这是一种具有每个有害类别独立自适应安全边际的直接偏好优化算法。当模型在某个类别上仍生成不安全响应时,该边际会收紧;一旦模型跟上,这一边际就会放宽,从而使训练信号跟踪每个类别当前的难度,而不是在一个全局速率下进行平均。我们在两个 LLM 主干模型和六个偏好学习基线上进行测试,Cat-DPO 在整体帮助fulness 和 harmlessness 上均取得改进,压缩了每个类别的安全方差和最差至最佳差距,为直接的偏好安全对齐提供一种即插即用的数据驱动式改进方法。
引用
@article{arxiv.2604.17299,
title = {Cat-DPO: Category-Adaptive Safety Alignment},
author = {Tiankai Yang and Yi Nian and Xinyuan Li and Ruiyao Xu and Kaize Ding and Yue Zhao},
journal= {arXiv preprint arXiv:2604.17299},
year = {2026}
}
备注
23 pages, 6 figures