用于认证鲁棒性的现成模型置信度感知去噪微调
计算机视觉与模式识别
2024-11-18 v2 人工智能
密码学与安全
机器学习
摘要
深度学习的显著进步催生了许多现成分类器,例如大型预训练模型。然而,由于它们通常在干净数据上训练,仍易受对抗攻击。尽管存在这一漏洞,但其卓越的性能和迁移性使得现成分类器在实践中仍具价值,这要求进一步的工作以事后方式为其提供对抗鲁棒性。最近提出的一种方法——去噪平滑,利用分类器前的去噪模型,在无需额外训练的情况下获得可证明的鲁棒性。然而,去噪器常产生幻觉,即丢失原分配类别语义的图像,导致鲁棒性下降。此外,其加噪-去噪过程引入了相对于原始分布的显著分布偏移,导致去噪平滑框架达到次优鲁棒性。本文提出了一种新颖的微调方案——基于置信度感知去噪图像选择的微调(FT-CADIS),以增强现成分类器的认证鲁棒性。FT-CADIS 受到这样一个观察的启发:现成分类器的置信度能有效识别去噪平滑过程中的幻觉图像。基于此,我们开发了一种置信度感知训练目标来处理此类幻觉图像,并提高从去噪图像微调的稳定性。这样,分类器可以仅使用有益于对抗鲁棒性的图像进行微调。我们还发现,这种微调可以通过仅更新分类器的一小部分参数来完成。大量实验表明,FT-CADIS 在各种基准上跨所有 对抗半径建立了去噪平滑方法中的最先进认证鲁棒性。
引用
@article{arxiv.2411.08933,
title = {Confidence-aware Denoised Fine-tuning of Off-the-shelf Models for Certified Robustness},
author = {Suhyeok Jang and Seojin Kim and Jinwoo Shin and Jongheon Jeong},
journal= {arXiv preprint arXiv:2411.08933},
year = {2024}
}
备注
26 pages; TMLR 2024; Code is available at https://github.com/suhyeok24/FT-CADIS