中文

Scene-Graph ViT:端到端开放词汇视觉关系检测

计算机视觉与模式识别 2024-07-22 v2 计算与语言 机器学习 机器人学

摘要

视觉关系检测旨在识别图像中的物体及其关系。先前的方法通过在现有物体检测架构上添加单独的关系模块或解码器来处理此任务。这种分离增加了复杂性,并阻碍了端到端训练,从而限制了性能。我们提出一种简单且高效的、无解码器的开放词汇视觉关系检测架构。我们的模型由一个基于 Transformer 的图像编码器组成,该编码器将物体表示为 token,并隐式地建模它们之间的关系。为提取关系信息,我们引入了一种注意力机制,用于选择可能形成关系的物体对。我们提供了一种单阶段方法,在物体和关系检测数据的混合数据集上训练该模型。我们的方法在 Visual Genome 和大词汇量 GQA 基准上,以实时推理速度实现了最先进的关系检测性能。我们提供了消融研究、真实世界的定性示例以及零样本性能分析。

关键词

引用

@article{arxiv.2403.14270,
  title  = {Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship Detection},
  author = {Tim Salzmann and Markus Ryll and Alex Bewley and Matthias Minderer},
  journal= {arXiv preprint arXiv:2403.14270},
  year   = {2024}
}

备注

ECCV camera-ready; changed to graph-constrained results