中文

探究对抗扰动中隐藏的可被人识别特征

机器学习 2023-10-02 v1 人工智能 计算机视觉与模式识别

摘要

神经网络在各种机器学习任务上表现极佳,但易受对抗扰动的攻击。这一脆弱性对现实应用有影响。尽管已有大量研究,神经网络为何遭受对抗攻击的根本原因尚未完全明了。我们研究的核心(在三个数据集上探索多达五种攻击算法)是识别对抗扰动中可被人识别的特征。此外,我们揭示了在可被人识别特征中表现的两种不同效应。具体而言,掩蔽效应在无目标攻击中突出,而生成效应在目标攻击中更常见。利用像素级标注,我们提取此类特征并展示其破坏目标模型的能力。另外,我们的发现表明,在多个模型上平均时,不同攻击算法的扰动存在显著程度的相似性。本工作还提供了与对抗扰动相关现象(如可迁移性与模型可解释性)的见解。我们的研究增进了对对抗攻击背后潜在机制的理解,并为开发更具韧性的神经网络防御策略提供了见解。

关键词

引用

@article{arxiv.2309.16878,
  title  = {Investigating Human-Identifiable Features Hidden in Adversarial Perturbations},
  author = {Dennis Y. Menn and Tzu-hsun Feng and Sriram Vishwanath and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2309.16878},
  year   = {2023}
}