中文

其中蕴含哪些概念?检测并抑制 Diffusion Transformer 中的风险内容

计算机视觉与模式识别 2026-05-20 v1 密码学与安全

摘要

文本到图像(T2I)模型的兴起日益引发了对其生成风险内容(如色情、暴力和受版权保护的图像)的担忧,凸显了在模型内部建立有效防护机制的必要性。尽管已有方法被提出以消除 T2I 模型中的风险概念,但它们主要针对早期的 U-Net 架构开发,导致 SOTA 的基于 Diffusion Transformer 的 T2I 模型未得到充分保护。这一差距源于基础架构的转变:Diffusion Transformer(DiT)通过联合注意力将语义注入与视觉合成纠缠在一起,使得在生成过程中难以隔离并擦除风险内容。为弥补这一差距,我们研究了语义概念在 DiT 中如何被表示,并发现注意力头表现出概念特定的敏感性。这一特性使得风险内容的检测与抑制成为可能。基于此发现,我们提出了 AHV-D\&S,一种用于 DiT 图像生成的免训练推理时防护机制。具体而言,AHV-D\&S 将每个文本 token 在所有注意力头上的敏感性量化为注意力头向量(AHV),作为检测风险生成倾向的判别性特征。在推理阶段,我们提出了一种基于动量的策略,以在去噪步骤间动态跟踪 token 级别的 AHV,并提出了一种敏感性引导的自适应抑制策略,根据特定于头的风险分数抑制已识别风险 token 的注意力权重。大量实验表明,AHV-D\&S 能有效抑制色情、版权风格及各类有害内容,同时保持视觉质量,并进一步展现出对对抗性 prompt 的强鲁棒性以及在不同基于 DiT 的 T2I 模型间的可迁移性。

关键词

引用

@article{arxiv.2605.10180,
  title  = {What Concepts Lie Within? Detecting and Suppressing Risky Content in Diffusion Transformers},
  author = {Chenyu Zhang},
  journal= {arXiv preprint arXiv:2605.10180},
  year   = {2026}
}

备注

arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission