大型预训练视觉 Transformer 是否自然地产生对象绑定?
计算机视觉与模式识别
2026-01-22 v2 人工智能
机器学习
神经元与认知
摘要
对象绑定——大脑将构成对象众多特征整合为连贯整体的能力——是人类认知的核心。它将低层感知特征分组为高层对象表示,高效且具组合性地存储这些对象,并支持人类就单个对象实例进行推理。尽管先前的工作常通过显式施加对象中心注意力(如 Slot Attention)来探测这些益处,但是否在预训练视觉 Transformer(ViT)中自然产生这种能力尚不明确。直观上,它们可能会:识别哪些 patch 属于同一对象应对下游预测有用,从而引导注意力。基于自注意力的二次性,我们假设 ViT 表示两个 patch 是否属于同一对象,我们称之为 IsSameObject。我们通过在 patch 嵌入跨 ViT 层上使用二次相似度探针来解码 IsSameObject,该探针达到 90% 以上的准确率。关键的是,这种对象绑定能力在 DINO、CLIP 和 ImageNet 监督 ViT 中可靠地出现,但在 MAE 中则明显较弱,这表明绑定并非简单的架构副产物,而是通过特定预训练目标获得的能力。我们进一步发现,IsSameObject 编码在对象特征之上的低维子空间中,并且该信号主动指导注意力。消除 IsSameObject 会降低下游性能并违背学习目标,暗示自然产生的对象绑定确实服务于预训练目标。我们的发现挑战了 ViT 缺乏对象绑定的观点,突显了符号知识“哪些部分彼此属于”在连接主义系统中自然涌现的作用。
关键词
引用
@article{arxiv.2510.24709,
title = {Does Object Binding Naturally Emerge in Large Pretrained Vision Transformers?},
author = {Yihao Li and Saeed Salehi and Lyle Ungar and Konrad P. Kording},
journal= {arXiv preprint arXiv:2510.24709},
year = {2026}
}
备注
Accepted as a Spotlight at NeurIPS 2025