拓展场景图边界:基于视觉—概念对齐与保留的完全开放词汇场景图生成
计算机视觉与模式识别
2024-10-08 v2
摘要
场景图生成(SGG)提供了一种在许多计算机视觉应用中至关重要的结构化表示。然而,传统SGG方法受限于闭集假设,只能识别预定义的对象与关系类别。为克服此限制,我们根据节点与边将SGG场景划分为四种不同设定:闭集SGG、基于开放词汇(对象)检测的SGG(OvD-SGG)、基于开放词汇关系的SGG(OvR-SGG)以及开放词汇检测+关系SGG(OvD+R-SGG)。尽管以对象为中心的开放词汇SGG近期已有研究,但更具挑战性的关系涉及型开放词汇SGG问题仍相对未被探索。为填补这一空白,我们从整体视角提出一个名为OvSGTR的统一框架,面向完全开放词汇SGG。该框架为一种端到端Transformer架构,其对节点与边学习视觉—概念对齐,使模型能够识别未见过类别。针对更具挑战性的关系涉及型开放词汇SGG设定,所提方法整合了利用图像—文本描述数据的关感知预训练,并通过知识蒸馏保留视觉—概念对齐。在Visual Genome基准上的综合实验结果证明了该框架的有效性与优越性。我们的代码见https://github.com/gpt4vision/OvSGTR/。
引用
@article{arxiv.2311.10988,
title = {Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and Retention},
author = {Zuyao Chen and Jinlin Wu and Zhen Lei and Zhaoxiang Zhang and Changwen Chen},
journal= {arXiv preprint arXiv:2311.10988},
year = {2024}
}