在自监督Transformer中发现分布式以对象为中心的特性
计算机视觉与模式识别
2026-03-30 v1 人工智能
计算与语言
机器学习
多媒体
摘要
自监督视觉Transformer(ViT)如DINO展现出发现对象的涌现能力,通常表现为最终层 token的注意力图。然而,这些图常包含虚假激活,导致对象定位不佳。这是因为在图像级目标上训练的 token会汇总整张图像而非聚焦于对象。这种聚合稀释了存在于局部块级交互中的以对象为中心的信息。我们通过计算所有层中基于块级注意力分量(查询、键和值)的块间相似性来分析这一现象。我们发现:(1) 以对象为中心的特性由所有三个分量(q、k、v)导出的相似性图编码,与先前仅使用键特征或 token的工作不同。(2) 这种以对象为中心的信息分布在网络中,而非仅局限于最终层。基于这些洞察,我们提出了Object-DINO,一种无需训练的提取这种分布式以对象为中心信息的方法。Object-DINO根据所有层中各头的块相似性对注意力头进行聚类,并自动识别与所有对象对应的以对象为中心的聚类。我们在两个应用中展示了Object-DINO的有效性:增强无监督对象发现(CorLoc提升+3.6至+12.4)以及通过提供视觉基础来缓解多模态大语言模型中的对象幻觉。我们的结果表明,利用这种分布式以对象为中心的信息可以在不进行额外训练的情况下提升下游任务。
引用
@article{arxiv.2603.26127,
title = {Finding Distributed Object-Centric Properties in Self-Supervised Transformers},
author = {Samyak Rawlekar and Amitabh Swain and Yujun Cai and Yiwei Wang and Ming-Hsuan Yang and Narendra Ahuja},
journal= {arXiv preprint arXiv:2603.26127},
year = {2026}
}
备注
Computer Vision and Pattern Recognition (CVPR) 2026