中文

美丽图像,有毒文字:理解并应对生成图像中的冒犯性文本

计算机视觉与模式识别 2026-01-16 v4

摘要

最先进的扩散模型(DMs)能生成高度逼真的图像。尽管先前的工作已成功缓解了视觉领域中的不安全(NSFW)内容,但我们发现了一个新的威胁:图像中嵌入的 NSFW 文本的生成。这包括侮辱性言论、种族歧视和露骨色情词汇等冒犯性语言,给用户带来了重大风险。我们表明,所有最先进的扩散模型(例如 SD3、SDXL、Flux、DeepFloyd IF)都容易受到此问题的影响。通过大量实验,我们证明,对视觉内容有效的现有缓解技术无法阻止有害文本的生成,同时会显著降低良性文本的生成质量。作为应对这一威胁的初步步骤,我们引入了一种新颖的微调策略,该策略仅针对扩散模型中的文本生成层。为此,我们构建了一个安全微调数据集,将每个 NSFW 提示词与两张图像配对:一张包含 NSFW 词汇,另一张则将该词汇替换为精心设计的良性替代词,同时保持图像其他部分不变。通过在此数据集上训练,模型学会避免生成有害文本,同时保留良性内容和整体图像质量。最后,为了推动该领域的研究,我们发布了 ToxicBench,这是一个用于评估图像中 NSFW 文本生成的开放基准。它包括我们精心构建的微调数据集、一组有害提示词、新的评估指标,以及一个评估 NSFW 程度及文本和图像质量的流程。我们的基准旨在指导未来在文本到图像模型中缓解 NSFW 文本生成的工作,从而为其安全部署做出贡献。

关键词

引用

@article{arxiv.2502.05066,
  title  = {Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images},
  author = {Aditya Kumar and Tom Blanchard and Adam Dziedzic and Franziska Boenisch},
  journal= {arXiv preprint arXiv:2502.05066},
  year   = {2026}
}

备注

Accepted at AAAI 2026 (AI Alignment Track)