中文

深度神经网络会被极度无法辨识的图像愚弄吗?

计算机视觉与模式识别 2022-03-29 v2

摘要

愚弄图像是深度神经网络(DNNs)的潜在威胁。这些图像在人类看来并非狗、猫等自然物体,却被 DNNs 以高置信度误分类为自然物体类别。尽管有最初的设计理念,现有愚弄图像若仔细观察仍保留一些目标物体的特征。因此,DNNs 会对这些特征作出反应。在本文中,我们探讨是否存在局部或全局均无自然物体特征模式的愚弄图像这一问题。作为最小情形,我们引入仅改动少数像素的单色图像,称为稀疏愚弄图像(SFIs)。我们首先证明在温和条件下 SFIs 对线性和非线性模型总是存在,并揭示复杂模型更易受 SFI 攻击。通过两种 SFI 生成方法,我们证明在更深层中,SFIs 最终具有与自然图像相似的特征,从而成功愚弄 DNNs。在其他层中,我们发现最大池化层导致了针对 SFIs 的脆弱性。我们还讨论了针对 SFIs 的防御与可迁移性。本研究通过引入一类与自然图像距离极远的新图像,揭示了 DNNs 的新脆弱性。

关键词

引用

@article{arxiv.2012.03843,
  title  = {Are DNNs fooled by extremely unrecognizable images?},
  author = {Soichiro Kumano and Hiroshi Kera and Toshihiko Yamasaki},
  journal= {arXiv preprint arXiv:2012.03843},
  year   = {2022}
}