SceneGraphVLM:基于视觉语言模型的视频动态场景图生成
计算机视觉与模式识别
2026-05-14 v1
摘要
场景图生成为视觉感知提供紧凑的结构化表示,但从图像和视频中进行准确且快速的图预测仍具有挑战性。最近的基于视觉语言模型VLM的方法可以以结构化文本形式端到端生成场景图,但常常产生冗长输出并包含无关对象和关系。我们提出SceneGraphVLM,一种针对图像和视频场景图生成的紧凑方法,采用小型视觉语言模型。SceneGraphVLM将图序列化为token高效的TOON格式,并采用两阶段训练:监督微调 followed by reinforcement learning with hallucination-aware rewards,以平衡关系覆盖和精度,同时惩罚不受支持的对象和关系。对于视频,模型可选择性地以先前生成的图为条件,为轻量级短期上下文提供上下文,无需跟踪或后处理。我们在PSG、PVSG和Action Genome上评估SceneGraphVLM。凭借紧凑的VLM和vLLM加速的解码,SceneGraphVLM实现了强劲的质量-速度权衡,改进了以精度为导向的场景图生成指标,同时保持合理的召回率,并以约1秒的延迟生成完整场景图。代码和实现细节可在:https://github.com/markus0440/SceneGraphVLM.git获取。
引用
@article{arxiv.2605.13667,
title = {SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models},
author = {Vladislav Makarov and Mark Gizetdinov and Dmitry Yudin},
journal= {arXiv preprint arXiv:2605.13667},
year = {2026}
}