视觉Transformer从自然图像中学习类似格式塔的图形-背景线索
计算机视觉与模式识别
2026-07-09 v1
摘要
人类视觉系统中的图形-背景组织依赖于几种基于形状的线索,包括包围性、凸性和对称性。虽然这些线索已使用抽象刺激进行了广泛研究,但关于它们在自然条件下如何运作或它们如何从自然场景的统计中产生,知之甚少。深度神经网络提供了一条有前途的前进道路:一个依赖与人类相同的图形-背景线索的模型将为潜在机制提供易处理的实验访问。在这项研究中,我们评估了视觉Transformer(ViT)中基于形状的图形-背景组织,先前的工作已证明其出现了基于对象的分组。我们测试了25个涵盖监督和自监督训练目标的ViT,通过拟合线性探针,使用自然图像和隔离单个线索的受控人工刺激,从中间补丁表示预测图形-背景分配。我们的结果表明,ViT鲁棒地编码了包围性和凸性,并且从自然图像训练的探针在多个模型上对人工刺激零样本泛化。对于对称性,我们观察到混合结果:该线索对均匀着色区域被编码,但对纹理区域则不然。总的来说,我们的发现表明,类似格式塔的图形-背景线索可以从自然场景统计中学习,并将ViT定位为一个引人注目的模型系统,用于研究感知组织的计算机制。代码和数据可在 https://github.com/mtangemann/mlvbench 获取。
引用
@article{arxiv.2607.08932,
title = {Vision Transformers Learn Gestalt-Like Figure-Ground Cues from Natural Images},
author = {Matthias Tangemann and Benjamin Lo and Zygmunt Pizlo and Kaleem Siddiqi and Dirk B. Walther and Sven Dickinson},
journal= {arXiv preprint arXiv:2607.08932},
year = {2026}
}