中文

从像素到图:基于视觉语言模型的开放词汇场景图生成

计算机视觉与模式识别 2024-04-25 v3

摘要

场景图生成旨在将视觉场景解析为中间图表示,以用于下游推理任务。尽管近期取得了进展,但现有方法仍难以生成包含新颖视觉关系概念的场景图。为应对这一挑战,我们引入了一种基于序列生成的开放词汇 SGG 新框架。我们的框架通过引入图到图的生成范式,利用了视觉语言预训练模型。具体而言,我们通过 VLM 进行图像到文本生成以产生场景图序列,随后从这些序列构建场景图。借此,我们利用了 VLM 在开放词汇 SGG 方面的强大能力,并无缝集成了显式关系建模以增强 VL 任务。实验结果表明,我们的设计不仅在开放词汇下取得了优越性能,还通过显式关系建模知识提升了下游视觉语言任务的性能。

关键词

引用

@article{arxiv.2404.00906,
  title  = {From Pixels to Graphs: Open-Vocabulary Scene Graph Generation with Vision-Language Models},
  author = {Rongjie Li and Songyang Zhang and Dahua Lin and Kai Chen and Xuming He},
  journal= {arXiv preprint arXiv:2404.00906},
  year   = {2024}
}

备注

Accepted by CVPR 2024