VLPrompt:面向全景场景图生成的视觉-语言提示
计算机视觉与模式识别
2024-06-21 v2
摘要
全景场景图生成(PSG)旨在通过同时分割对象并预测对象间关系来实现全面的图像理解。然而,关系中的长尾问题导致在真实应用中结果不尽如人意。先前方法主要依赖视觉信息或利用有限的语言信息(如对象或关系名称),从而忽视了语言信息的效用。借助大语言模型(LLM)的最新进展,我们提出利用语言信息辅助关系预测,尤其针对稀有关系。为此,我们提出视觉-语言提示(VLPrompt)模型,其从图像获取视觉信息并从LLM获取语言信息。随后,通过基于注意力机制的提示网络实现精确的关系预测。我们的大量实验表明,VLPrompt在PSG数据集上显著优于先前最先进方法,证明了引入语言信息及缓解关系长尾问题的有效性。代码见\url{https://github.com/franciszzj/TP-SIS}。
引用
@article{arxiv.2311.16492,
title = {VLPrompt: Vision-Language Prompting for Panoptic Scene Graph Generation},
author = {Zijian Zhou and Miaojing Shi and Holger Caesar},
journal= {arXiv preprint arXiv:2311.16492},
year = {2024}
}
备注
22 pages, 9 figures