使用视觉语言模型的开放世界场景图生成
计算机视觉与模式识别
2025-06-11 v1 计算与语言
摘要
场景图生成(SGG)旨在识别图像中的对象并提取其显著的成对关系。大多数方法依赖于特定数据集的监督来学习各种交互,这限制了它们在涉及新对象和/或新关系的开放世界场景中的适用性。即使是利用大型视觉语言模型(VLM)的方法通常也需要针对特定基准进行微调。我们引入了 Open-World SGG,这是一个免训练、高效且模型无关的框架,直接利用 VLM 的预训练知识来生成场景图,无需任何额外学习。将 SGG 构建为零样本结构化推理问题,我们的方法结合了多模态提示、嵌入对齐和轻量级成对细化策略,能够对未见对象词汇表和关系集进行推理。为了评估这一设定,我们形式化了一个 Open-World 评估协议,用于衡量在未观察到任何 SGG 特定数据(无论是对象还是关系方面)时的性能。在 Visual Genome、Open Images V6 和全景场景图(PSG)数据集上的实验表明,预训练的 VLM 具备在无需任务级训练的情况下执行关系理解的能力。
引用
@article{arxiv.2506.08189,
title = {Open World Scene Graph Generation using Vision Language Models},
author = {Amartya Dutta and Kazi Sajeed Mehrab and Medha Sawhney and Abhilash Neog and Mridul Khurana and Sepideh Fatemi and Aanish Pradhan and M. Maruf and Ismini Lourentzou and Arka Daw and Anuj Karpatne},
journal= {arXiv preprint arXiv:2506.08189},
year = {2025}
}
备注
Accepted in CVPR 2025 Workshop (CVinW)