FIQ:集成问题嵌入的基于基本问题生成的视频问答
计算机视觉与模式识别
2025-07-18 v1 人工智能
摘要
视频问答是一种需要解释视频以回答给定问题的多模态任务。现有方法主要利用问题-答案(Q&A)对学习视频内容的时空特征,但这些标注通常以事件为中心,难以捕捉每个视频更广泛的上下文。缺乏essential details(如对象类型、空间布局和描述性属性)限制了模型仅学习片段化场景表征的能力。这严重制约了模型的泛化能力和高层次推理能力。本文提出一种基于基本问题生成集成问题嵌入的视频问答方法(FIQ),旨在通过增强对视频的基本理解来强化模型的推理能力。FIQ 根据从视频中提取的描述生成 Q&A 对,丰富了包含基本场景信息的训练数据。生成的 Q&A 对使模型能够理解主要上下文,从而提升泛化能力和推理能力。此外,我们引入 VQ-CAlign 模块,辅助任务特定的问题嵌入与视觉特征对齐,确保关键领域特定细节得以保留,提高下游任务的适应性。在 SUTD-TrafficQA 数据集上实验表明,FIQ 相较于现有基线方法实现了业界最佳性能。
关键词
引用
@article{arxiv.2507.12816,
title = {FIQ: Fundamental Question Generation with the Integration of Question Embeddings for Video Question Answering},
author = {Ju-Young Oh and Ho-Joong Kim and Seong-Whan Lee},
journal= {arXiv preprint arXiv:2507.12816},
year = {2025}
}
备注
SMC 2025