中文

超越感知之门:视觉 Transformer 表示对象之间的关系

计算机视觉与模式识别 2024-11-26 v3 人工智能

摘要

虽然视觉 Transformer (ViT) 在各种场景中取得了最前沿的性能,但在执行涉及视觉关系的任务时表现出意想不到的失败。这引出了一个问题:ViT 如何尝试执行需要计算对象之间视觉关系的任务?以往的解释性工作倾向于关注描述相关低级视觉特征。相反,我们采用机制解释性方法来研究 ViT 用于执行抽象视觉推理的高级视觉算法。我们present了一种基础且 surprisingly difficult 的关系推理任务:判断两个视觉实体是否相同或不同。我们发现,针对该任务 fine-tuning 的预训练 ViT 往往表现出两种qualitatively不同的处理阶段,尽管它们没有明显的归纳偏置:1) 感知阶段,其中提取局部对象特征并存储于解耦表示中;2) 关系阶段,其中比较对象表示。在第二个阶段,我们发现 ViT 能够学习表示某种抽象视觉关系的能力,这一能力长期被认为是人工神经网络无法实现的。最后,我们展示了任一阶段的失败都可能阻止模型学习对该简单任务的通用解决方案。通过将 ViT 理解为离散处理阶段的方式,可以更精确地诊断和纠正现有和未来模型的短板。

关键词

引用

@article{arxiv.2406.15955,
  title  = {Beyond the Doors of Perception: Vision Transformers Represent Relations Between Objects},
  author = {Michael A. Lepori and Alexa R. Tartaglini and Wai Keen Vong and Thomas Serre and Brenden M. Lake and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2406.15955},
  year   = {2024}
}