中文

基于文本到图像扩散模型的对抗鲁棒化

计算机视觉与模式识别 2024-07-29 v1 机器学习

摘要

对抗鲁棒性传统上被认为是神经网络难以编码的属性,需要大量训练数据。然而在近期采用现成模型的范式下,获取它们的训练数据往往不可行或不实用,而大多数此类模型也并未针对对抗鲁棒性进行训练。本文发展了一种可扩展且模型无关的数据免费方案,以实现对抗鲁棒性。我们的直觉是将最近的文本到图像扩散模型视为具有可调节性的去噪器,可针对特定任务进行优化。基于此,我们提出:(a) 初始化一个去噪-分类管道,能对抗攻击提供可证明的保证;(b) 利用从文本到图像模型生成的少量合成参考图像,实现新颖的适应方案。我们的实验表明,应用在预训练的 CLIP 上可显著提高其 diverse zero-shot 分类衍生品(同时保持准确率)的(可证明的)对抗鲁棒性,显著超越使用完整训练数据的先前方法。除了 CLIP,我们还展示了该框架可轻松应用于其他视觉分类器的鲁棒化。

关键词

引用

@article{arxiv.2407.18658,
  title  = {Adversarial Robustification via Text-to-Image Diffusion Models},
  author = {Daewon Choi and Jongheon Jeong and Huiwon Jang and Jinwoo Shin},
  journal= {arXiv preprint arXiv:2407.18658},
  year   = {2024}
}

备注

Code is available at https://github.com/ChoiDae1/robustify-T2I