中文

探究隐藏哪里?面向大规模扩散模型的概念审计

机器学习 2025-10-07 v2 人工智能 密码学与安全 计算机视觉与模式识别

摘要

扩散模型(Diffusion Models, DMs)已彻底改变文本到图像的生成领域,使其能够从文本提示中创建高度逼真且可定制的图像。随着参数高效微调(PEFT)技术的兴起,用户现在可以使用最小的计算资源定制强大的预训练模型。然而,随着这些模型在开放平台上的广泛共享,日益增长的伦理和法律顾虑使得这些模型可能无意或蓄意生成敏感或未经授权的内容。尽管生成式人工智能正日益受到监管关注,但目前尚无实用工具可在部署前系统性审计这些模型。本文解决概念审计问题:确定经过微调的扩散模型是否学习了生成特定目标概念的能力。现有方法通常依赖基于提示的输入构建和基于输出的图像分类,但存在提示不确定性、概念漂移和规模性差等关键局限。为克服这些挑战,我们引入了基于提示无关且无图像的审计框架(Prompt-Agnostic Image-Free Auditing, PAIA)。通过将扩散模型视为审计对象,PAIA enables 对内部模型行为进行直接分析,绕过优化提示或生成图像的需求。我们在320个使用精心挑选概念数据集训练的受控模型和771个来自公共扩散模型共享平台的真实世界社区模型上进行评估。评估结果表明,PAIA 在检测准确率上超过90%,同时将审计时间缩短了18-40倍。就目前可行的扩散模型部署前概念审计方案而言,PAIA 是首个可扩展且实用的解决方案,为更安全、更透明的扩散模型共享提供了实用基础。

关键词

引用

@article{arxiv.2504.14815,
  title  = {What Lurks Within? Concept Auditing for Shared Diffusion Models at Scale},
  author = {Xiaoyong Yuan and Xiaolong Ma and Linke Guo and Lan Zhang},
  journal= {arXiv preprint arXiv:2504.14815},
  year   = {2025}
}

备注

Extended version of the paper accepted at CCS 2025