理解针对流形上对抗样本的对抗鲁棒性
机器学习
2022-10-04 v1 密码学与安全
摘要
深度神经网络(DNNs)已被证明易受对抗样本的攻击。一个训练良好的模型只需在原始数据上添加微小扰动即可被轻易攻击。对抗样本存在的一种假设是离流形假设:对抗样本位于数据流形之外。然而,近期研究表明流形上对抗样本同样存在。在本文中,我们重新审视离流形假设,并希望研究一个问题:神经网络在对抗攻击下表现不佳,在多大程度上是由流形上对抗样本导致的?由于真实数据流形在实践中未知,我们考虑在真实与合成数据集上两种近似的流形上对抗样本。在真实数据集上,我们表明在标准训练和对抗训练模型上,流形上对抗样本的攻击率均高于离流形对抗样本。在合成数据集上,我们从理论上证明流形上对抗样本具有强大攻击力,但对抗训练聚焦于离流形方向而忽略了流形上对抗样本。此外,我们提供分析表明理论推导的性质在实践中同样可被观察到。我们的分析指出流形上对抗样本十分重要,在训练鲁棒模型时应给予更多关注。
引用
@article{arxiv.2210.00430,
title = {Understanding Adversarial Robustness Against On-manifold Adversarial Examples},
author = {Jiancong Xiao and Liusha Yang and Yanbo Fan and Jue Wang and Zhi-Quan Luo},
journal= {arXiv preprint arXiv:2210.00430},
year = {2022}
}