通过贝叶斯攻击提升对抗样本的可迁移性
机器学习
2025-10-16 v2 密码学与安全
计算机视觉与模式识别
摘要
对抗样本的可迁移性使得针对未知深度神经网络(DNNs)的攻击成为可能,对诸多应用构成严重威胁并引发广泛关注。本文将贝叶斯公式同时引入模型参数与模型输入,实现二者的联合多样化,从而提升对抗样本的可迁移性。我们证明,对模型输入与模型参数二者均采用贝叶斯公式相结合可显著改善可迁移性。通过引入对模型输入上后验分布的高级近似,对抗可迁移性获得进一步增强,在无模型微调的攻击中超越所有现有最优方法。此外,我们提出一种在该贝叶斯框架内微调模型参数的原则性方法。大量实验表明,我们的方法在基于迁移的攻击中达到了新的最优水平,在 ImageNet 与 CIFAR-10 上显著提升了平均成功率。代码见:https://github.com/qizhangli/MoreBayesian-jrnl。
引用
@article{arxiv.2307.11334,
title = {Improving Transferability of Adversarial Examples via Bayesian Attacks},
author = {Qizhang Li and Yiwen Guo and Xiaochen Yang and Wangmeng Zuo and Hao Chen},
journal= {arXiv preprint arXiv:2307.11334},
year = {2025}
}
备注
Accepted by TCSVT