中文

超越安全税:通过外部安全校正缓解不安全文本到图像生成

计算机视觉与模式识别 2026-01-21 v3 人工智能 密码学与安全

摘要

文本到图像(T2I)生成模型在视觉保真度方面取得了显著进展,但仍然容易生成不安全内容。现有的安全防御通常在生成模型内部进行干预,但会导致严重的概念纠缠,引起对良好生成质量的下降,我们称之为安全税。为克服这一限制,我们提倡从破坏性内部编辑转向外部安全校正。遵循这一原则,我们提出 SafePatch,一个结构上独立的安全模块,进行外部、可解释的校正而不修改基础模型。SafePatch 的核心背板以基础模型编码器的可训练克隆体实现,使其能够继承丰富的语义先验并保持表示一致性。为实现可解释的安全校正,我们构建了一个严格对齐的反事实安全数据集(ACS),用于差分监督训练。 在裸露和多类别基准以及最新的对抗性提示攻击中,SafePatch 实现了稳健的不安全抑制(在 I2P 上不安全率为 7%),同时保持图像质量和语义对齐。

关键词

引用

@article{arxiv.2508.21099,
  title  = {Beyond the Safety Tax: Mitigating Unsafe Text-to-Image Generation via External Safety Rectification},
  author = {Xiangtao Meng and Yingkai Dong and Ning Yu and Li Wang and Zheng Li and Shanqing Guo},
  journal= {arXiv preprint arXiv:2508.21099},
  year   = {2026}
}