鲁棒化人工神经网络揭示人类类别感知间的虫洞
计算机视觉与模式识别
2023-10-05 v2 人工智能
神经元与认知
摘要
人工神经网络(ANNs)的视觉对象类别报告对微小的对抗性图像扰动极为敏感。由于人类类别报告(即人类感知)被认为对这些相同的小范数扰动不敏感——且总体上局部稳定——这说明 ANNs 是不完整的人类视觉感知科学模型。与此一致,我们表明当小范数图像扰动由标准 ANN 模型生成时,人类对象类别感知确实高度稳定。然而,正是在这一“人类假定稳定”的 regime 中,我们发现鲁棒化 ANNs 能可靠地发现强烈破坏人类感知的低范数图像扰动。这些先前无法检测的人类感知破坏幅度巨大,接近鲁棒化 ANNs 中所见的相同敏感水平。此外,我们表明鲁棒化 ANNs 支持精确的感知状态干预:它们引导构建低范数图像扰动,将人类类别感知强烈改变为特定的指定感知。这些观察表明,对于图像空间中的任意起点,存在一组邻近的“虫洞”,每个都将受试者从其当前类别感知状态带入语义上非常不同的状态。而且,当代生物视觉处理的 ANN 模型现已足够准确,可一致地引导我们到达这些入口。
引用
@article{arxiv.2308.06887,
title = {Robustified ANNs Reveal Wormholes Between Human Category Percepts},
author = {Guy Gaziv and Michael J. Lee and James J. DiCarlo},
journal= {arXiv preprint arXiv:2308.06887},
year = {2023}
}
备注
In NeurIPS 2023. Code: https://github.com/ggaziv/Wormholes Project Webpage: https://himjl.github.io/pwormholes