中文

超越孤立事实:用于VideoQA的叙事与 grounding 监督信号合成

计算机视觉与模式识别 2025-09-30 v1 计算与语言

摘要

Video问答(VideoQA)模型的性能在本质上受限于其监督方式,通常仅包含孤立的事实问答对。这种“事实袋”方法未能捕捉事件的底层叙事与因果结构,限制了模型对视频内容的浅层理解。为突破这一范式,我们提出一个框架来合成更丰富的监督信号。我们提出两种互补策略:(i)问基于改写(Question-Based Paraphrasing, QBP),从视频现有的问答对集合中合成出多样化的询问(what、how、why),重构视频事件结构的整体叙事段落;(ii)问基于描述(Question-Based Captioning, QBC),为每个问题生成细粒度的视觉依据,将答案锚定在特定相关证据上。依托强大的生成模型,我们利用这些合成数据以统一的下一个标记预测目标训练VideoQA模型。在STAR和NExT-QA上的大规模实验验证了我们的方法,展示了显著的准确率提升,创下新纪录,如使3B模型在STAR上达到72.5%(提升4.9%),7B模型在NExT-QA上达到80.8%。除准确率外,我们的分析表明,QBP和QBC均显著提升了跨数据集的泛化能力,其中QBP还使模型收敛速度提高超过2.5倍。这些结果表明,将数据合成从孤立事实转向叙事连贯性和 grounding 依据,构建更准确、更高效且更具通用性的训练范式。

关键词

引用

@article{arxiv.2509.24445,
  title  = {Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA},
  author = {Jianxin Liang and Tan Yue and Yuxuan Wang and Yueqian Wang and Zhihan Yin and Huishuai Zhang and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2509.24445},
  year   = {2025}
}