中文

用于欺骗与解释深度网络的攻击方法

计算机视觉与模式识别 2021-06-22 v1 人工智能 密码学与安全 机器学习

摘要

深度视觉模型易受针对输入的对抗性扰动影响。尽管这些信号经过精心构造,但在人类看来仍呈现为类噪声模式。该观察引发了关于深度视觉表征与人类感知不一致的争论。我们提出反驳,并提供证据表明对抗性扰动中存在具有人类语义的模式。我们首先提出一种攻击,使网络将整类物体(源类别)误判为目标标签。该攻击同时限制了来自非源类别的样本被意外欺骗,从而界定了用于网络欺骗的人类定义语义概念。我们表明,所提攻击不仅导致扰动中出现规则几何图案,还揭示了关于深度模型决策边界的深刻信息。进一步探索该现象后,我们改变了攻击的“对抗”目标,将其用作“解释”深度视觉表征的工具。我们表明,通过精心引导并投影由本方法计算的扰动,可以可视化模型对人类定义语义概念的理解。最后,我们利用扰动的解释性属性,通过对抗鲁棒“分类器”进行对抗攻击,实现图像生成、修复与交互式图像操控。总之,我们的主要贡献是一种新颖的实用对抗攻击,其随后被转化为解释视觉模型的工具。本文还通过确立该攻击在对抗目标之外的多种有趣应用中的效用,做出了次要贡献。

关键词

引用

@article{arxiv.2106.10606,
  title  = {Attack to Fool and Explain Deep Networks},
  author = {Naveed Akhtar and Muhammad A. A. K. Jalwana and Mohammed Bennamoun and Ajmal Mian},
  journal= {arXiv preprint arXiv:2106.10606},
  year   = {2021}
}

备注

To appear in IEEE TPAMI. arXiv admin note: text overlap with arXiv:1905.11544