中文

人类能够破译对抗图像

计算机视觉与模式识别 2019-08-27 v3 计算机与社会 机器学习

摘要

人类心智与反映其性能的复杂机器学习系统有多相似?基于卷积神经网络(CNNs)的物体分类模型已在为新颖图像分配已知标签的任务中达到人类水平基准。这些进展有望支撑自动驾驶和机器诊断等变革性技术;此外,它们也作为视觉系统本身的候选模型——不仅在其输出上,或许甚至在其底层机制和原理上。然而,与人类视觉不同,CNNs 可被对抗样本“愚弄”——精心制作的图像对人类看似无意义图案但被机器识别为熟悉物体,或对人类看似某物体而对机器看似另一物体。这种人类与机器分类之间看似极端的差异,挑战了这些新进展作为应用图像识别系统和人类心智模型的前景。然而令人惊讶的是,极少有工作实证考察人类对此类对抗刺激的分类:人类与机器性能是否根本分歧?或者人类能否破译此类图像并预测机器偏好的标签?在此,我们表明人类与机器对对抗刺激的分类稳健相关:在五个著名且多样的对抗图像集上的八个实验中,人类受试者可靠地识别出机器所选标签而非相关干扰项。该模式在具有强先验身份的图像上持续,甚至在被描述为“人眼完全无法辨认”的图像上亦然。我们认为,人类直觉可能是比通常设想的更可靠的机器(错误)分类指南,并探讨该结果对心智与机器的共同影响。

关键词

引用

@article{arxiv.1809.04120,
  title  = {Humans can decipher adversarial images},
  author = {Zhenglong Zhou and Chaz Firestone},
  journal= {arXiv preprint arXiv:1809.04120},
  year   = {2019}
}

备注

14 pages, 4 figures