中文

拓展场景图边界:基于视觉—概念对齐与保留的完全开放词汇场景图生成

计算机视觉与模式识别 2024-10-08 v2

摘要

场景图生成(SGG)提供了一种在许多计算机视觉应用中至关重要的结构化表示。然而,传统SGG方法受限于闭集假设,只能识别预定义的对象与关系类别。为克服此限制,我们根据节点与边将SGG场景划分为四种不同设定:闭集SGG、基于开放词汇(对象)检测的SGG(OvD-SGG)、基于开放词汇关系的SGG(OvR-SGG)以及开放词汇检测+关系SGG(OvD+R-SGG)。尽管以对象为中心的开放词汇SGG近期已有研究,但更具挑战性的关系涉及型开放词汇SGG问题仍相对未被探索。为填补这一空白,我们从整体视角提出一个名为OvSGTR的统一框架,面向完全开放词汇SGG。该框架为一种端到端Transformer架构,其对节点与边学习视觉—概念对齐,使模型能够识别未见过类别。针对更具挑战性的关系涉及型开放词汇SGG设定,所提方法整合了利用图像—文本描述数据的关感知预训练,并通过知识蒸馏保留视觉—概念对齐。在Visual Genome基准上的综合实验结果证明了该框架的有效性与优越性。我们的代码见https://github.com/gpt4vision/OvSGTR/。

关键词

引用

@article{arxiv.2311.10988,
  title  = {Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and Retention},
  author = {Zuyao Chen and Jinlin Wu and Zhen Lei and Zhaoxiang Zhang and Changwen Chen},
  journal= {arXiv preprint arXiv:2311.10988},
  year   = {2024}
}