中文

VLPrompt:面向全景场景图生成的视觉-语言提示

计算机视觉与模式识别 2024-06-21 v2

摘要

全景场景图生成(PSG)旨在通过同时分割对象并预测对象间关系来实现全面的图像理解。然而,关系中的长尾问题导致在真实应用中结果不尽如人意。先前方法主要依赖视觉信息或利用有限的语言信息(如对象或关系名称),从而忽视了语言信息的效用。借助大语言模型(LLM)的最新进展,我们提出利用语言信息辅助关系预测,尤其针对稀有关系。为此,我们提出视觉-语言提示(VLPrompt)模型,其从图像获取视觉信息并从LLM获取语言信息。随后,通过基于注意力机制的提示网络实现精确的关系预测。我们的大量实验表明,VLPrompt在PSG数据集上显著优于先前最先进方法,证明了引入语言信息及缓解关系长尾问题的有效性。代码见\url{https://github.com/franciszzj/TP-SIS}。

关键词

引用

@article{arxiv.2311.16492,
  title  = {VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation},
  author = {Zijian Zhou and Miaojing Shi and Holger Caesar},
  journal= {arXiv preprint arXiv:2311.16492},
  year   = {2024}
}

备注

22 pages, 9 figures