中文

Espresso:面向文本到图像模型的鲁棒概念过滤

计算机视觉与模式识别 2025-02-27 v7 密码学与安全

摘要

基于扩散的文本到图像模型训练于从互联网上抓取的大型数据集中,可能包含不可接受的概念(例如侵犯版权或不安全的内容)。我们需要概念删除技术(CRTs),其要求包括:i) 在防止生成具有不可接受概念的图像方面有效,ii) 在可接受概念上保持实用性,以及 iii) 对于带有对抗性提示的规避具有鲁棒性。目前没有任何已有的CRTs能够同时满足上述所有要求。我们引入Espresso,这是一种基于对比语言-图像预训练(CLIP)的鲁棒概念过滤器。我们通过使用生成图像的嵌入与不可接受概念及可接受概念的文本嵌入之间的距离来识别不可接受概念。这使我们能够通过在保持实用性的同时分离不可接受与可接受概念的文本嵌入来实现鲁棒性微调。我们提出了一种评估various CRTs的管道,以显示Espresso在有效性和鲁棒性上优于先前的CRTs,同时保持实用性。

关键词

引用

@article{arxiv.2404.19227,
  title  = {Espresso: Robust Concept Filtering in Text-to-Image Models},
  author = {Anudeep Das and Vasisht Duddu and Rui Zhang and N. Asokan},
  journal= {arXiv preprint arXiv:2404.19227},
  year   = {2025}
}

备注

ACM Conference on Data and Application Security and Privacy (CODASPY), 2025