中文

桥接视觉语言模型与符号 grounding:视频问答方法

计算机视觉与模式识别 2025-09-16 v1 人工智能 机器学习

摘要

视频问答需要模型在视频中进行空间、时间和因果线索的推理。近期视觉语言模型 (VLM) 取得了强大的成绩,但往往依赖浅层关联,导致时间 grounding 较弱且可解释性有限。我们研究将符号场景图 (SG) 作为视频问答的中间 grounding 信号。SG 提供了结构化的对象-关系表示,补充了 VLM 的整体推理。我们引入了 SG-VLM,一个模块化框架,将冻结的 VLM 与场景图 grounding 集成,通过提示和视觉局部化实现。我们在三个基准数据集 (NExT-QA、iVQA、ActivityNet-QA) 上进行实验,并测试了多个 VLM (QwenVL、InternVL)。SG-VLM 在因果和时间推理方面均取得了改进,超过了先前的基线方法;尽管在强 VLM 上提升有限,但仍显示出显著的效果。这一发现既凸显了符号 grounding 的前景,也揭示了其当前的局限性,为未来的混合 VLM-符号方法在视频理解中的应用提供了指导。

关键词

引用

@article{arxiv.2509.11862,
  title  = {Bridging Vision Language Models and Symbolic Grounding for Video Question Answering},
  author = {Haodi Ma and Vyom Pathak and Daisy Zhe Wang},
  journal= {arXiv preprint arXiv:2509.11862},
  year   = {2025}
}