中文

面向Grounded Video QA的触发时机定位:增强多模态大语言模型的时空定位能力

计算机视觉与模式识别 2025-11-05 v1

摘要

在本技术报告中,我们介绍了一个解决Grounded Video Question Answering(GVQA)任务的框架,旨在参赛于ICCV 2025 Perception Test Challenge。GVQA任务要求具备鲁棒的多模态模型,能够对视频内容进行复杂推理,结果答案在视觉上进行定位,并在时间上跟踪被引用的对象。为实现此能力,我们的 proposed方法将GVQA任务分解为三个阶段的管线:(1)视频推理与问答、(2)时空定位和(3)跟踪。我们的关键贡献是引入一个触发时机,源自我们提出的CORTEX提示,该时机 pinpoint了目标对象最可见的单个帧,作为定位和跟踪的稳健锚点。为此,我们实现了0.4968的HOTA得分,这在GVQA任务上显著优于去年获奖得分的0.2704。

关键词

引用

@article{arxiv.2511.02182,
  title  = {Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models},
  author = {Jinhwan Seo and Yoonki Cho and Junhyug Noh and Sung-eui Yoon},
  journal= {arXiv preprint arXiv:2511.02182},
  year   = {2025}
}

备注

1st place winner of Grounded Videoqa track at the ICCV2025 Perception Test