中文

AlignGuard:面向文本到图像生成的可扩展安全对齐

计算机视觉与模式识别 2025-07-01 v2 人工智能 机器学习

摘要

文本到图像(T2I)模型已被广泛使用,但其有限的安全护栏使用户暴露于有害内容,并可能允许模型被滥用。当前的安全措施通常局限于基于文本的过滤或概念移除策略,仅能从模型的生成能力中移除少数概念。在本工作中,我们引入了 AlignGuard,一种用于 T2I 模型安全对齐的方法。我们通过合成生成一个由有害和安全的图文对组成的数据集(我们称之为 CoProV2),从而在 T2I 模型中实现直接偏好优化(DPO)在安全目的上的应用。使用定制的 DPO 策略和该数据集,我们训练了以低秩适应(LoRA)矩阵形式存在的安全专家,能够引导生成过程远离特定的安全相关概念。然后,我们使用一种新颖的合并策略将这些专家合并为单个 LoRA,以实现最佳扩展性能。这种基于专家的方法实现了可扩展性,使我们能够从 T2I 模型中移除比基线多 7 倍的有害概念。AlignGuard 在许多基准测试上始终优于现有技术,并为 T2I 网络的安全对齐确立了新实践。代码和数据将在 https://safetydpo.github.io/ 共享。

关键词

引用

@article{arxiv.2412.10493,
  title  = {AlignGuard: Scalable Safety Alignment for Text-to-Image Generation},
  author = {Runtao Liu and I Chieh Chen and Jindong Gu and Jipeng Zhang and Renjie Pi and Qifeng Chen and Philip Torr and Ashkan Khakzar and Fabio Pizzati},
  journal= {arXiv preprint arXiv:2412.10493},
  year   = {2025}
}