对抗对齐:打破攻击强度与人类感知相关性之间的权衡
计算机视觉与模式识别
2023-06-07 v1 人工智能
摘要
深度神经网络(DNNs)已知对对抗攻击具有根本性的敏感性,即人类不可察觉但足以改变模型视觉决策的输入扰动。对抗攻击长期以来被认为是深度学习的“阿喀琉斯之踵”,最终可能迫使建模范式发生转变。然而,现代大规模DNNs的强大能力在一定程度上掩盖了这些早期担忧。对抗攻击是否继续对DNNs构成威胁?在此,我们研究随着DNNs在ImageNet上的准确率持续提升,其对对抗攻击的鲁棒性如何演变。我们以两种不同方式衡量对抗鲁棒性:首先,我们测量导致模型改变物体分类决策所需的最小对抗攻击。其次,我们测量成功攻击与人类发现用于物体识别的诊断性特征的对齐程度。我们发现,随着DNNs在ImageNet上表现更好,对抗攻击正诱导出更大且更易被察觉的图像像素变化,但这些攻击也变得愈发不与人类发现用于识别的诊断性特征对齐。为了更好地理解这种权衡的来源,我们转向神经协调器(neural harmonizer),一种鼓励模型利用与人类相同的特征来解决任务的DNN训练例程。协调后的DNNs实现了两全其美,所遭受的攻击是可检测的且影响人类发现用于识别的诊断性特征,这意味着对这些模型的攻击更可能通过诱导类似的人类感知效应而失效。我们的发现表明,DNNs对对抗攻击的敏感性可通过DNN规模、数据规模和使模型与生物智能对齐的训练例程来缓解。
引用
@article{arxiv.2306.03229,
title = {Adversarial alignment: Breaking the trade-off between the strength of an attack and its relevance to human perception},
author = {Drew Linsley and Pinyuan Feng and Thibaut Boissin and Alekh Karkada Ashok and Thomas Fel and Stephanie Olaiya and Thomas Serre},
journal= {arXiv preprint arXiv:2306.03229},
year = {2023}
}