中文

OpenPSG:基于大型多模态模型的开放式全景场景图生成

计算机视觉与模式识别 2024-07-17 v1

摘要

全景场景图生成(PSG)旨在分割对象并识别其关系,从而实现对图像的结构化理解。以前的方法聚焦于预测预定义的对象和关系类别,从而限制了其在开放世界场景中的应用。随着大型多模态模型(LMM)的快速发展,开放式目标检测和分割取得了显著进展,但PSG中的开放式关系预测仍未得到探索。本文聚焦于将开放式关系预测集成到预训练的开放式全景分割模型中,以实现真正的开放式全景场景图生成(OpenPSG)。我们的OpenPSG利用LMM以自回归方式实现开放式关系预测。我们引入一种关系查询变换器,高效地提取对象对的视觉特征并估计它们之间的关系是否存在。后者可以通过过滤不相关的配对来增强预测效率。最后,我们设计生成和判断指令,以在PSG中自回归地执行开放式关系预测。到我们知识的, 我们是首次提出开放式PSG任务。广泛的实验表明,我们的方法在开放式关系预测和全景场景图生成方面实现了最先进的性能。代码可在\url{https://github.com/franciszzj/OpenPSG}获取。

关键词

引用

@article{arxiv.2407.11213,
  title  = {OpenPSG: Open-set Panoptic Scene Graph Generation via Large Multimodal Models},
  author = {Zijian Zhou and Zheng Zhu and Holger Caesar and Miaojing Shi},
  journal= {arXiv preprint arXiv:2407.11213},
  year   = {2024}
}

备注

ECCV 2024