频率图揭示对抗攻击与隐式偏置的相关性
机器学习
2025-04-09 v3 人工智能
密码学与安全
机器学习
摘要
尽管神经网络在分类任务中表现优异,但已知其易受对抗攻击——即旨在欺骗模型的输入数据的细微扰动。本工作中,我们研究了这些扰动与使用基于梯度的算法训练的神经网络之隐式偏置之间的相关性。为此,我们通过傅里叶变换的视角分析网络隐式偏置的表示。具体而言,我们通过计算每幅图像准确分类所需的最小、本质频率,以及驱动其对抗扰动对应物误分类的频率,来识别隐式偏置和对抗攻击的独特指纹。该方法使我们能够揭示并分析这些本质频率之间的相关性,从而精确描绘网络偏置与对抗攻击所利用的频率分量之间是一致还是对立。为此,除其他方法外,我们使用了一种新引入的能够检测高维数据集间非线性相关的技术。我们的结果提供了经验证据:傅里叶空间中的网络偏置与对抗攻击的目标频率高度相关,并暗示了对抗防御的新潜在策略。
引用
@article{arxiv.2305.15203,
title = {Frequency maps reveal the correlation between Adversarial Attacks and Implicit Bias},
author = {Lorenzo Basile and Nikos Karantzas and Alberto d'Onofrio and Luca Manzoni and Luca Bortolussi and Alex Rodriguez and Fabio Anselmi},
journal= {arXiv preprint arXiv:2305.15203},
year = {2025}
}
备注
Accepted at IJCNN 2025