显著性抑制、语义浮现:神经网络与大脑中的视觉变换
计算机视觉与模式识别
2024-04-30 v1 人工智能
摘要
深度学习算法缺乏人类可解释的说明,关于它们如何将原始视觉输入转换为稳健的语义理解,这阻碍了不同架构、训练目标和人脑之间的比较。在这项工作中,我们从神经科学中汲取灵感,采用表征方法来揭示神经网络如何在低(视觉显著性)和高(语义相似性)抽象层次上编码信息。此外,我们引入了一个自定义图像数据集,在其中系统地操纵显著性和语义信息。我们发现,当使用对象分类目标进行训练时,ResNet 比 ViT 对显著性信息更敏感。我们揭示了网络在早期层中抑制显著性,这一过程在 ResNet 中通过自然语言监督(CLIP)得到增强。CLIP 还增强了两种架构中的语义编码。最后,我们表明语义编码是将人工智能与人类视觉感知对齐的关键因素,而显著性抑制是一种非类脑策略。
引用
@article{arxiv.2404.18772,
title = {Saliency Suppressed, Semantics Surfaced: Visual Transformations in Neural Networks and the Brain},
author = {Gustaw Opiełka and Jessica Loke and Steven Scholte},
journal= {arXiv preprint arXiv:2404.18772},
year = {2024}
}