中文

DTVI:面向安全文本到图像生成的双阶段文本与视觉干预

计算机视觉与模式识别 2026-03-31 v2

摘要

文本到图像(T2I)扩散模型已展现出强大的生成能力,但其潜在生成不安全内容的能力引发了显著的安全顾虑。现有推理时防御方法通常在文本嵌入空间中进行类别不可感知的标记级干预,无法捕捉跨越完整标记序列的恶意语义,且对对抗性提示仍保持脆弱。本文提出DTVI,一种面向安全T2I生成的双阶段推理时防御框架。不同于干预特定标记嵌入的方法,我们在完整提示嵌入上引入类别感知的序列级干预,以更好地捕捉分布式恶意语义,并进一步在视觉生成阶段减弱剩余不安全影响。实验在真实世界的不安全提示、对抗性提示和多个有害类别上显示,我们的方法在保持对良性提示合理生成质量的同时,实现了有效且稳健的防御,在性别类别基准测试中平均防御成功率(DSR)达94.43%,在七类不安全类别中达88.56%。

关键词

引用

@article{arxiv.2603.22041,
  title  = {DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation},
  author = {Binhong Tan and Zhaoxin Wang and Handing Wang},
  journal= {arXiv preprint arXiv:2603.22041},
  year   = {2026}
}