中文

面向文本到图像扩散模型的 NSFW 内容擦除的全面评估与分析

计算机视觉与模式识别 2025-02-19 v1

摘要

文本到图像 (T2I) 扩散模型在各个领域获得了广泛应用,展现出惊人的创造潜力。然而,这些模型的强大泛化能力可能导致即使在努力从训练数据集中过滤 NSFW 内容后,也会生成 NSFW 内容,这对其安全部署构成风险。虽然已提出多种概念擦除方法来缓解此问题,但其有效性的全面评估仍缺失。为填补这一空白,我们present了对 NSFW 内容及其子主题在文本到图像扩散模型中概念擦除方法的首个系统性调查。在任务层面,我们提供了 11 种最先进基准方法及其 14 种变体的全面评估。具体从六个不同的评估视角进行分析,包括三个传统视角,即擦除比例、图像质量和语义对齐,以及三个新视角,即过度擦除、明确和隐式不安全提示的影响以及鲁棒性。在工具层面,我们对 NSFW 数据集进行了详细的毒性分析,并比较了不同 NSFW 分类器的性能,为更深入的理解提供了洞察,同时汇编了全面的评估指标。我们的基准不仅系统评估了概念擦除方法,还深入探讨了其性能受影响因素。通过综合各种评估视角的洞见,我们提供了对该领域挑战与机遇的更深入理解,为推动该领域的研究和实际应用提供了可操作的指导和灵感。

关键词

引用

@article{arxiv.2502.12527,
  title  = {Comprehensive Assessment and Analysis for NSFW Content Erasure in Text-to-Image Diffusion Models},
  author = {Die Chen and Zhiwen Li and Cen Chen and Xiaodan Li and Jinyan Ye},
  journal= {arXiv preprint arXiv:2502.12527},
  year   = {2025}
}