中文

R.A.C.E.: 用于安全文本到图像扩散模型的鲁棒对抗概念擦除

计算机视觉与模式识别 2024-07-24 v2

摘要

在文本到图像(T2I)扩散模型不断发展的背景下,从文本描述生成高质量图像的卓越能力面临着再现敏感内容潜在滥用的挑战。为了解决这一关键问题,我们引入了鲁棒对抗概念擦除(RACE),这是一种新颖的方法,旨在通过增强T2I模型概念擦除方法的鲁棒性来缓解这些风险。RACE利用一个复杂的对抗训练框架来识别和缓解对抗性文本嵌入,显著降低了攻击成功率(ASR)。令人印象深刻的是,针对领先的白盒攻击方法,RACE在“裸体”概念上实现了ASR降低30个百分点。我们的广泛评估证明了RACE在防御白盒和黑盒攻击方面的有效性,标志着在保护T2I扩散模型免于生成不当或误导性图像方面取得了重大进展。这项工作强调了在适应快速发展的对抗挑战领域时采取主动防御措施的必要性。我们的代码公开可用:\url{https://github.com/chkimmmmm/R.A.C.E.}

关键词

引用

@article{arxiv.2405.16341,
  title  = {R.A.C.E.: Robust Adversarial Concept Erasure for Secure Text-to-Image Diffusion Model},
  author = {Changhoon Kim and Kyle Min and Yezhou Yang},
  journal= {arXiv preprint arXiv:2405.16341},
  year   = {2024}
}

备注

Accepted at ECCV 2024