深度神经网络中格式塔分组的混合证据
人工智能
2023-02-21 v3
摘要
格式塔心理学家已识别出一系列条件,在这些条件下人类将场景元素组织为一个组或整体,而知觉分组原则在场景感知与物体识别中起着重要作用。最近,在自然图像(ImageNet)上训练的深度神经网络(DNNs)因据报道其在多种脑与行为基准上表现良好,而被提议作为人类视觉的引人注目的模型。在此,我们在点阵刺激(实验 1)和产生强烈格式塔效应的更复杂形状刺激(实验 2)上测试了共 16 个网络,涵盖多种架构与学习范式(卷积、基于注意力、监督与自监督、前馈与循环)。在实验 1 中,我们发现卷积网络确实以类人的方式对邻近性、线性和朝向原则敏感,但仅出现在输出层。在实验 2 中,我们发现大多数网络仅对少数刺激集表现出格式塔效应,且同样仅出现在处理的最后阶段。总体而言,自监督与 Vision-Transformer 在人类相似性方面似乎比卷积网络表现更差。值得注意的是,没有任何模型在处理早期或中间阶段呈现出分组效应。这与广泛假设的格式塔发生于物体识别之前、并确实为物体识别而组织视觉场景相矛盾。我们的总体结论是,尽管在简单 2D 图像上训练的网络在输出层支持对某些刺激的一种格式塔分组形式值得注意,但这种能力似乎不能迁移到更复杂的特征。此外,这种分组仅发生在最后一层的事实表明,网络学习到的知觉属性与人类根本不同。
引用
@article{arxiv.2203.07302,
title = {Mixed Evidence for Gestalt Grouping in Deep Neural Networks},
author = {Valerio Biscione and Jeffrey S. Bowers},
journal= {arXiv preprint arXiv:2203.07302},
year = {2023}
}
备注
Accepted in Computational Brain & Behaviour