中文

UFID:扩散模型上输入级后门检测的统一框架

密码学与安全 2025-02-05 v2 计算机视觉与模式识别 机器学习

摘要

扩散模型容易受到后门攻击,恶意攻击者在训练阶段通过投毒某些训练样本来注入后门。这对模型即服务 场景中的现实应用构成了重大威胁,用户通过 API 查询扩散模型或直接从互联网下载它们。为了减轻 MaaS 下后门攻击的威胁,黑盒输入级后门检测最近引起了人们的兴趣,防御者旨在构建一个防火墙,在推理阶段过滤掉后门样本,且只能访问输入查询和扩散模型的生成结果。尽管在传统分类任务上有了一些初步探索,但由于两个主要挑战,这些方法不能直接应用于生成任务:(1) 更多样化的失败模式和 (2) 多模态攻击面。在本文中,我们提出了一个关于扩散模型的黑盒输入级后门检测框架,称为 UFID。我们的防御方法源于有洞察力的因果分析:后门攻击作为混杂因素,引入了从输入到目标图像的虚假路径,即使我们用高斯噪声扰动输入样本,该路径仍保持一致。我们进一步通过理论分析验证了这一直觉。在不同数据集上对条件和无条件扩散模型的大量实验表明,我们的方法在检测有效性和运行时间效率方面均取得了卓越的性能。

关键词

引用

@article{arxiv.2404.01101,
  title  = {UFID: A Unified Framework for Input-level Backdoor Detection on Diffusion Models},
  author = {Zihan Guan and Mengxuan Hu and Sheng Li and Anil Vullikanti},
  journal= {arXiv preprint arXiv:2404.01101},
  year   = {2025}
}

备注

18 pages,24 figures