模糊度调节:提升对抗样本的迁移性
机器学习
2023-03-20 v1 密码学与安全
计算机视觉与模式识别
摘要
随着对抗攻击的发展,对抗样本已被广泛用于增强深度神经网络训练模型的鲁棒性。尽管在提升对抗样本迁移性方面已做出大量努力,但基于迁移的攻击在替代模型上的攻击成功率远高于在受害模型上的攻击成功率,尤其是在低攻击强度下(例如攻击强度 )。在本文中,我们首先系统地研究了该问题,发现替代模型与受害模型之间攻击成功率的巨大差异是由一个特殊区域(我们在文中称为模糊域)的存在引起的,该区域内的对抗样本被替代模型错误分类而被受害模型正确分类。然后,为消除这种攻击成功率的巨大差异以提升所生成对抗样本的迁移性,我们提出了一种由置信度缩放机制与温度缩放机制组成的模糊度调节方法,以确保生成的对抗样本能有效跳出模糊域。置信度缩放机制与温度缩放机制分别通过调节模糊度的梯度下降权重与稳定更新方向,协同调节所生成对抗样本的模糊度。具体而言,所提出的模糊度调节方法可有效集成到现有对抗攻击中,在不改变时间复杂度的前提下进一步提升对抗样本的迁移性。大量实验表明,模糊度调节方法能有效增强最新基于迁移的攻击中对抗样本的迁移性。
引用
@article{arxiv.2303.10078,
title = {Fuzziness-tuned: Improving the Transferability of Adversarial Examples},
author = {Xiangyuan Yang and Jie Lin and Hanlin Zhang and Xinyu Yang and Peng Zhao},
journal= {arXiv preprint arXiv:2303.10078},
year = {2023}
}