我走数线:检验 Gestalt 连续性在视觉 Transformer 物体绑定中的作用
计算机视觉与模式识别
2026-04-14 v1 人工智能
摘要
物体绑定是视觉认知中的基础过程,在此过程中,低层感知特征被整合成物体表征。物体绑定一直被视为神经网络面临的根本性挑战,是实现灵活视觉智能的人工模型的重要里程碑。最近几项研究已提供证据表明,绑定机制在预训练视觉模型中涌现,使其能够关联包含物体的图像片段。然而,这些模型是如何进行物体绑定的 remains 不明。本文我们检验视觉模型是否在其他原理(如相似性和邻近性)之外,依赖 Gestalt 连续性原理来执行物体绑定。我们使用合成数据集,证明绑定探针对广泛的预训练视觉 Transformer 都敏感于连续性。随后,我们发现特定注意力头跟踪连续性,并展示这些头跨数据集泛化。最后,我们剔除这些注意力头,证明它们常常有助于产生编码物体绑定的表征。
引用
@article{arxiv.2604.09942,
title = {I Walk the Line: Examining the Role of Gestalt Continuity in Object Binding for Vision Transformers},
author = {Alexa R. Tartaglini and Michael A. Lepori},
journal= {arXiv preprint arXiv:2604.09942},
year = {2026}
}