中文

M-ErasureBench:面向扩散模型概念擦除的综合性多模态评估基准

计算机视觉与模式识别 2025-12-30 v1

摘要

文本到图像的扩散模型可能会生成有害或受版权保护的内容,这促使了对概念擦除的研究。然而,现有的方法主要集中在从文本提示中擦除概念,忽略了在图像编辑和个性化生成等实际应用中日益关键的其他输入模态。这些模态可能成为攻击面,尽管有防御措施,被擦除的概念仍会重新出现。为了弥合这一差距,我们引入了 M-ErasureBench,这是一个新颖的多模态评估框架,系统地跨三种输入模态对概念擦除方法进行基准测试:文本提示、学习到的嵌入和反转潜变量。对于后两者,我们评估了白盒和黑盒访问,产生了五种评估场景。我们的分析表明,现有方法对文本提示实现了强大的擦除性能,但在学习到的嵌入和反转潜变量下基本失效,在白盒设置中概念重现率(CRR)超过90%。为了解决这些漏洞,我们提出了 IRECE(概念擦除的推理时鲁棒性增强),这是一个即插即用的模块,它通过交叉注意力定位目标概念,并在去噪过程中扰动相关的潜变量。实验表明,IRECE 一致地恢复了鲁棒性,在最具挑战性的白盒潜变量反转场景下将CRR降低了高达40%,同时保持了视觉质量。据我们所知,M-ErasureBench 提供了超越文本提示的首个概念擦除综合基准。结合 IRECE,我们的基准为构建更可靠的保护性生成模型提供了实用的保障。

关键词

引用

@article{arxiv.2512.22877,
  title  = {M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models},
  author = {Ju-Hsuan Weng and Jia-Wei Liao and Cheng-Fu Chou and Jun-Cheng Chen},
  journal= {arXiv preprint arXiv:2512.22877},
  year   = {2025}
}