中文

显著性抑制、语义浮现:神经网络与大脑中的视觉变换

计算机视觉与模式识别 2024-04-30 v1 人工智能

摘要

深度学习算法缺乏人类可解释的说明,关于它们如何将原始视觉输入转换为稳健的语义理解,这阻碍了不同架构、训练目标和人脑之间的比较。在这项工作中,我们从神经科学中汲取灵感,采用表征方法来揭示神经网络如何在低(视觉显著性)和高(语义相似性)抽象层次上编码信息。此外,我们引入了一个自定义图像数据集,在其中系统地操纵显著性和语义信息。我们发现,当使用对象分类目标进行训练时,ResNet 比 ViT 对显著性信息更敏感。我们揭示了网络在早期层中抑制显著性,这一过程在 ResNet 中通过自然语言监督(CLIP)得到增强。CLIP 还增强了两种架构中的语义编码。最后,我们表明语义编码是将人工智能与人类视觉感知对齐的关键因素,而显著性抑制是一种非类脑策略。

关键词

引用

@article{arxiv.2404.18772,
  title  = {Saliency Suppressed, Semantics Surfaced: Visual Transformations in Neural Networks and the Brain},
  author = {Gustaw Opiełka and Jessica Loke and Steven Scholte},
  journal= {arXiv preprint arXiv:2404.18772},
  year   = {2024}
}