面向文本到图像扩散变换器的稳健与可泛化安全驾驶
人工智能
2026-05-29 v1
摘要
扩散变换器已成为文本到图像生成的强大 backbone,但其分层和跨模态生成过程使得安全控制与基于提示的过滤或基于输出的检测 fundamentally不同。有害语义可能在文本表示中弱表达,逐步绑定到视觉潜在空间,最终与渲染动力学 entangled。因此,在固定层进行安全驾驶会不稳定,由已知风险学习的驾驶机制可能无法在偏移目标风险域中可靠迁移。我们提出SafeDIG——一个安全驾驶框架,将扩散变换器的安全适应表述为位置感知稀疏特征迁移。SafeDIG首先在功能上不同的扩散变换器干预位置上构建稀疏自编码器(Sparse Autoencoders),并使用鲁棒性感知的预训练路由以优先选择预期在源-目标风险迁移下保持稳定的干预位置。随后,通过冻结 SAE 编码器作为可重复使用的稀疏安全字典,仅适配解码器以适应目标域的激活流形,从而将可迁移的安全特征与域特定的激活几何进行分离。在推理阶段,SafeDIG结合Blend与Repel操作,将不安全的激活引导至迁移后的安全流形或远离有害稀疏方向。在FLUX.1 Dev和Stable Diffusion 3.5 Large上的实验表明,SafeDIG在保持源域安全性和图像质量的同时,显著降低了目标域和整体不安全生成率。
引用
@article{arxiv.2605.30049,
title = {Robust and Generalizable Safety Steering for Text-to-Image Diffusion Transformers},
author = {Zihao Xue and Yan Wang and Zhen Bi and Long Ma and Zhonglong Zheng and Zeyu Yang and Bingyu Zhu and Longtao Huang and Jie Xiao and Jungang Lou},
journal= {arXiv preprint arXiv:2605.30049},
year = {2026}
}