中文

NDM:针对文本到图像生成中隐式性意图的噪声驱动检测与缓解框架

计算机视觉与模式识别 2025-10-20 v1 人工智能

摘要

尽管文本到图像(T2I)扩散模型在生成能力方面取得了惊人的进展,但它们在面对隐式性性意图时仍然脆弱。与明确的有害意图不同,这些微妙的线索常被包装成看似良性的术语,却因模型偏见而意外触发性内容,引发重大伦理争议。然而,现有检测方法主要针对明确的性内容设计,难以检测这些隐式线索。微调方法虽在某种程度上有效,但会损害模型的生成质量,导致不愿的权衡。为此,我们提出NDM——首个噪声驱动的检测与缓解框架,能够在保留模型原始生成能力的同时检测并缓解T2I生成中的隐式恶意意图。具体而言,我们提出两个关键创新:首先,我们利用早期阶段预测噪声的可分性,开发噪声基检测方法,能够高精度高效识别恶意内容;其次,我们提出噪声增强的自适应负向引导机制,通过抑制突出区域的注意力,优化初始噪声,从而增强自适应负向引导在性缓解方面的效果。实验在自然数据集和对抗数据集上进行了验证,表明NDM在现有SOTA方法(包括SLD、UCE、RECE等)之上表现卓越。代码和资源地址:https://github.com/lorraine021/NDM

关键词

引用

@article{arxiv.2510.15752,
  title  = {NDM: A Noise-driven Detection and Mitigation Framework against Implicit Sexual Intentions in Text-to-Image Generation},
  author = {Yitong Sun and Yao Huang and Ruochen Zhang and Huanran Chen and Shouwei Ruan and Ranjie Duan and Xingxing Wei},
  journal= {arXiv preprint arXiv:2510.15752},
  year   = {2025}
}

备注

10 pages, 8 figures, accepted by ACMMM 2025