中文

如何对一致性模型进行后门攻击?

密码学与安全 2025-02-18 v3 计算机视觉与模式识别 机器学习

摘要

一致性模型是一类新型模型,通过将噪声直接映射到数据来生成图像,允许一步生成并显著加速采样过程。然而,它们对对抗性攻击的鲁棒性尚未得到深入研究。在这项工作中,我们首次研究了一致性模型对后门攻击的脆弱性。虽然之前的研究已经探讨了对扩散模型的后门攻击,但这些研究主要集中在传统的扩散模型上,采用了定制的后门训练过程和目标,而一致性模型具有独特的训练过程和目标。我们提出的框架证明了一致性模型对后门攻击的脆弱性。在图像生成过程中,当从高斯噪声采样时,被植入后门的一致性模型生成的图像具有与干净模型相当的 Fréchet Inception Distance (FID)。然而,一旦触发器被激活,它们就会生成后门目标图像。我们探索了各种触发器和目标配置来评估一致性模型的脆弱性,包括使用随机噪声作为触发器。这种新型触发器在视觉上不引人注目,更难被检测,并且与一致性模型的采样过程非常契合。在所有配置中,我们的框架在保持高实用性和特异性的同时,成功地攻破了一致性模型。我们还检查了所提出攻击的隐蔽性,这归因于一致性模型的独特属性和高斯噪声触发器的难以察觉的性质。我们的代码可在 \href{https://github.com/chengenw/backdoorCM}{https://github.com/chengenw/backdoorCM} 获取。

关键词

引用

@article{arxiv.2410.19785,
  title  = {How to Backdoor Consistency Models?},
  author = {Chengen Wang and Murat Kantarcioglu},
  journal= {arXiv preprint arXiv:2410.19785},
  year   = {2025}
}