为何少许鲁棒性反而有益?迈向理解对抗可迁移性的进一步研究
机器学习
2025-12-17 v8 密码学与安全
计算机视觉与模式识别
摘要
深度神经网络(DNNs)的对抗样本(AEs)已被证明具有可迁移性:成功欺骗白盒替代模型的对抗样本也能欺骗具有不同架构的其他黑盒模型。尽管大量实证研究为生成高可迁移对抗样本提供了指导,许多发现缺乏解释甚至给出不一致的建议。本文中,我们向理解对抗可迁移性迈进一步,特别关注替代模型方面。从引人注目的少许鲁棒性(little robustness)现象出发——即用轻微扰动的对抗样本进行对抗训练的模型可作为更好的替代模型——我们将其归因于两个主导因素之间的权衡:模型平滑度与梯度相似度。我们的研究聚焦于它们的联合效应,而非它们各自与可迁移性的相关性。通过一系列理论与实证分析,我们推测对抗训练中的数据分布偏移解释了梯度相似度的退化。基于这些洞见,我们探索数据增强与梯度正则化对可迁移性的影响,并识别出该权衡普遍存在于各种训练机制中,从而构建出可迁移性背后调节机制的全面蓝图。最后,我们提供构建更好替代模型以提升可迁移性的一般路径,即同时优化模型平滑度与梯度相似度,例如输入梯度正则化与锐度感知最小化(SAM)的结合,并经大量实验验证。总之,我们呼吁关注这两因素的联合影响以发起有效迁移攻击,而非优化其一而忽略另一,并强调操纵替代模型的关键作用。
引用
@article{arxiv.2307.07873,
title = {Why Does Little Robustness Help? A Further Step Towards Understanding Adversarial Transferability},
author = {Yechao Zhang and Shengshan Hu and Leo Yu Zhang and Junyu Shi and Minghui Li and Xiaogeng Liu and Wei Wan and Hai Jin},
journal= {arXiv preprint arXiv:2307.07873},
year = {2025}
}
备注
IEEE Symposium on Security and Privacy (Oakland) 2024; Extended version; Fix an proof error of Theorem 1