从数据到建模:全开放词表场景图生成
计算机视觉与模式识别
2025-05-27 v1
摘要
我们提出了 OvSGTR,一种用于全开放词表场景图生成的新型基于 Transformer 的框架,克服了传统闭集模型的局限性。传统方法将目标和关系识别限制在固定词表内,阻碍了它们在频繁出现新概念的真实场景中的适用性。相比之下,我们的方法联合预测超出预定义类别的目标(节点)及其相互关系(边)。OvSGTR 利用类似 DETR 的架构,该架构具有冻结的图像主干网络和文本编码器,以提取高质量的视觉和语义特征,随后通过 Transformer 解码器进行融合,实现端到端的场景图预测。为了丰富模型对复杂视觉关系的理解,我们提出了一种关系感知预训练策略,以弱监督方式合成场景图标注。具体而言,我们研究了三种流水线——基于场景解析器的、基于 LLM 的和基于多模态 LLM 的——以最少的标注生成可迁移的监督信号。此外,我们通过结合视觉概念保留机制和知识蒸馏策略,解决了开放词表设置中常见的灾难性遗忘问题,确保模型在微调期间保留丰富的语义线索。在 VG150 基准上的大量实验表明,OvSGTR 在多种设置下均取得了 SOTA 性能,包括闭集、基于开放词表目标检测的、基于关系的以及全开放词表场景。我们的结果突出了大规模关系感知预训练和 Transformer 架构在推动场景图生成向更泛化和可靠的视觉理解发展方面的潜力。
关键词
引用
@article{arxiv.2505.20106,
title = {From Data to Modeling: Fully Open-vocabulary Scene Graph Generation},
author = {Zuyao Chen and Jinlin Wu and Zhen Lei and Chang Wen Chen},
journal= {arXiv preprint arXiv:2505.20106},
year = {2025}
}