LLaVA-SpaceSGG: 用于改进空间关系的开放词汇场景图生成视觉指令调优
计算机视觉与模式识别
2024-12-10 v1
摘要
场景图生成 (SGG) 将视觉场景转换为结构化图表示, 为复杂视觉任务提供更深入的场景理解。然而,现有的 SGG 模型常常忽视关键空间关系,且在开放词汇上下文中难以实现泛化。为此,我们提出 LLaVA-SpaceSGG,这是一种为开放词汇 SGG 设计的多模态大语言模型 (MLLM),具备增强的空间关系建模能力。为训练它,我们收集了名为 SpaceSGG 的 SGG 指令调优数据集。该数据集由组合公开数据集和在数据构建管道中使用开源模型合成的数据构成。它结合了对象位置、对象关系和深度信息, resulting in 三种数据格式: 空间 SGG 描述、问答和对话。为增强 MLLM 固有能力向 SGG 任务的迁移,我们引入两种阶段的训练范式。实验表明, LLaVA-SpaceSGG 在其他开放词汇 SGG 方法上显著优于基线,召回率提升 8.6%,平均召回率提升 28.4%。我们的代码、数据集和训练好的模型均可在 GitHub 上公开访问,网址为: https://github.com/Endlinc/LLaVA-SpaceSGG
引用
@article{arxiv.2412.06322,
title = {LLaVA-SpaceSGG: Visual Instruct Tuning for Open-vocabulary Scene Graph Generation with Enhanced Spatial Relations},
author = {Mingjie Xu and Mengyang Wu and Yuzhi Zhao and Jason Chun Lok Li and Weifeng Ou},
journal= {arXiv preprint arXiv:2412.06322},
year = {2024}
}
备注
Accepted by the WACV 2025, including supplementary material