中文

VOST-SGG:面向视觉语言模型的单阶段时空场景图生成

计算机视觉与模式识别 2025-12-09 v2

摘要

时空场景图生成(ST-SGG)旨在建模对象及其在视频帧之间演化的关系,为下游推理任务如视频描述和视觉问答提供可解释表示。尽管近期发展出DETR风格的单阶段ST-SGG模型,但仍存在若干关键局限性。首先,虽然这些模型依赖于基于注意力的可学习查询作为核心组件,但这些可学习查询是语义上不信息且对实例不敏感地初始化的。其次,这些模型仅依赖单模态视觉特征进行谓词分类。为此,我们提出VOST-SGG,一个集成视觉语言模型(VLM)常识推理能力的单阶段ST-SGG框架。首先,我们引入双源查询初始化策略,将关注对象的内容与关注位置分离,实现语义上基于 what-where 的推理。此外,我们提出多模态特征库,融合来自VLM的视觉、文本和空间线索,以提高谓词分类性能。在Action Genome数据集上的大量实验表明,我们的方法实现了最先进的性能,验证了将VLM辅助语义先验和多模态特征集成到ST-SGG中的有效性。我们将在https://github.com/LUNAProject22/VOST发布代码。

关键词

引用

@article{arxiv.2512.05524,
  title  = {VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation},
  author = {Chinthani Sugandhika and Chen Li and Deepu Rajan and Basura Fernando},
  journal= {arXiv preprint arXiv:2512.05524},
  year   = {2025}
}