GPT4SGG:从整体和区域特定描述合成场景图
计算机视觉与模式识别
2024-06-04 v2
摘要
使用自然语言描述训练场景图生成(SGG)模型变得越来越流行,因为自然语言提供了丰富、经济且具有开放世界泛化能力的监督信号。然而,这种非结构化的描述数据及其处理给学习准确和全面的场景图带来了重大挑战。这些挑战可概括为三个方面:1)基于语言表示的传统场景图解析器通常无法从描述数据中提取有意义的关系三元组。2)将未定位的解析三元组对象进行接地会在视觉-语言对齐中遇到歧义问题。3)描述数据通常是稀疏的,并且对图像内容的部分观察存在偏差。为了解决这些问题,我们提出了一种分治策略,使用名为\textit{GPT4SGG}的新框架,以获得更准确和全面的场景图信号。该框架将复杂场景分解为一系列简单区域,产生一组特定区域的描述。利用这些特定区域的描述(部分观察)和图像的全局描述(全局观察),大语言模型(LLM)执行关系推理以合成准确和全面的场景图。实验结果表明,\textit{GPT4SGG}显著提高了在图像-描述数据上训练的SGG模型的性能,其中歧义问题和长尾偏差通过更准确和全面的场景图得到了很好的处理。
引用
@article{arxiv.2312.04314,
title = {GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives},
author = {Zuyao Chen and Jinlin Wu and Zhen Lei and Zhaoxiang Zhang and Changwen Chen},
journal= {arXiv preprint arXiv:2312.04314},
year = {2024}
}