视觉异画揭示全息形状加工中跨视觉模型的隐蔽差异
计算机视觉与模式识别
2025-11-25 v3 人工智能
摘要
人类能够基于局部纹理线索和物体部件的配置来识别物体,而当代视觉模型主要依赖局部纹理线索,导致特征脆弱且不可组合。形状与纹理偏差研究将形状与纹理表征置于对立中,衡量形状相对于纹理,忽视了模型(以及人类)可能同时依赖这两种线索的可能性,同时遮蔽了这两种表征的绝对质量。因此,我们将形状评估重新定义为绝对配置能力的问题,借此通过配置形状得分(Configural Shape Score, CSS)来实现,该指标(i)衡量能够识别对象异画对中两幅图像的能力,这些图像在保持局部纹理的同时扰乱全局部件配置,以呈现不同的物体类别。在86个卷积、Transformer和混合模型中,CSS(ii)揭示了广泛的配置灵敏度谱,其中自监督且语言对齐的Transformer -- 例如 DINOv2、SigLIP2 和 EVA-CLIP -- 位于CSS谱的上端。机制探针显示(iii)高CSS网络依赖于长程相互作用:半径控制的注意力掩码会消除性能,呈现独特的U形集成轮廓,表征相似性分析则暴露了从局部到全局编码的中层转变。BagNet 控制仍停留在随机水平(iv),排除了“边境作弊”策略。最后(v)我们表明,配置形状得分还能预测其他形状依赖评估。总体而言,我们提出,致力于构建真正稳健、可泛化且类人视觉系统的路径,可能不在于强制在形状与纹理之间做出人工选择,而在于能够无缝集成局部纹理和全局配置形状的架构和学习框架。
引用
@article{arxiv.2507.00493,
title = {Visual Anagrams Reveal Hidden Differences in Holistic Shape Processing Across Vision Models},
author = {Fenil R. Doshi and Thomas Fel and Talia Konkle and George Alvarez},
journal= {arXiv preprint arXiv:2507.00493},
year = {2025}
}
备注
Project page: https://www.fenildoshi.com/configural-shape/ updated email address