面向Grounded Video QA的触发时机定位:增强多模态大语言模型的时空定位能力
计算机视觉与模式识别
2025-11-05 v1
摘要
在本技术报告中,我们介绍了一个解决Grounded Video Question Answering(GVQA)任务的框架,旨在参赛于ICCV 2025 Perception Test Challenge。GVQA任务要求具备鲁棒的多模态模型,能够对视频内容进行复杂推理,结果答案在视觉上进行定位,并在时间上跟踪被引用的对象。为实现此能力,我们的 proposed方法将GVQA任务分解为三个阶段的管线:(1)视频推理与问答、(2)时空定位和(3)跟踪。我们的关键贡献是引入一个触发时机,源自我们提出的CORTEX提示,该时机 pinpoint了目标对象最可见的单个帧,作为定位和跟踪的稳健锚点。为此,我们实现了0.4968的HOTA得分,这在GVQA任务上显著优于去年获奖得分的0.2704。
引用
@article{arxiv.2511.02182,
title = {Pinpointing Trigger Moment for Grounded Video QA: Enhancing Spatio-temporal Grounding in Multimodal Large Language Models},
author = {Jinhwan Seo and Yoonki Cho and Junhyug Noh and Sung-eui Yoon},
journal= {arXiv preprint arXiv:2511.02182},
year = {2025}
}
备注
1st place winner of Grounded Videoqa track at the ICCV2025 Perception Test