中文

基于提示词的安全指导对未学习的文本到图像扩散模型无效

机器学习 2025-11-13 v2 人工智能 计算机视觉与模式识别

摘要

近期文本到图像生成模型的快速进步引发了当提供恶意输入提示词时可能产生有害内容的担忧。为解决此问题,已出现两种主要方法:(1) 对模型进行微调以“遗忘”有害概念,或 (2) 采用训练-free 方法,通过利用负面提示词实现引导。然而,我们观察到将这两种正交方法组合往往导致边际甚至性能下降。这一观察表明两种范式之间存在关键不兼容性,妨碍了其组合效应。在本文中,我们提出一种概念上简单却在实验上稳健的方法:用通过概念反转获取的隐式负面嵌入(implicit negative embeddings)取代训练-free 方法中使用的负面提示词。该方法无需修改这两种方法,即可轻松集成到现有流程中。我们在裸露和暴力基准测试中对其有效性进行了实验验证,结果显示在保持输入提示词核心语义的同时,防御成功率得到一致性提升。

关键词

引用

@article{arxiv.2511.04834,
  title  = {Prompt-Based Safety Guidance Is Ineffective for Unlearned Text-to-Image Diffusion Models},
  author = {Jiwoo Shin and Byeonghu Na and Mina Kang and Wonhyeok Choi and Il-Chul Moon},
  journal= {arXiv preprint arXiv:2511.04834},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025 Workshop on Generative and Protective AI for Content Creation