中文

LeAdQA:基于大语言模型的上下文感知时序 grounding 用于视频问答

计算机视觉与模式识别 2025-08-19 v2 人工智能

摘要

视频问答(VideoQA)需要识别长视频中稀疏的关键时刻,并推理其因果关系,以回答语义复杂的问题。尽管多模态学习的最新进展提高了对齐和融合效果,但当前方法因两种根本性错误策略仍受限:(1)任务无关抽样不加区分地处理所有帧,导致关键事件被无关内容淹没;(2)启发式检索仅捕获浅层模式,却忽略复杂推理所需的因果时序结构。为此,我们提出 LeAdQA,一种通过协同因果感知查询细化与细粒度视觉 grounding 来弥补差距的创新方法。我们的 method 首先利用大语言模型(LLM)重构问答对,消除因果歧义,聚焦时序细节。这些精炼后的查询随后指引时序 grounding 模型精准检索最关键片段,辅以自适应融合机制动态整合证据以最大化相关性。集成的视觉-文本线索随后由多模态大语言模型(MLLM)处理,生成准确且具上下文 grounding 的答案。在 NExT-QA、IntentQA 和 NExT-GQA 上的实验表明,我们的方法在精准视觉 grounding 上显著提升了视频-问题关系理解,同时保持计算效率,在复杂推理任务上实现最新水平(SOTA)性能。

关键词

引用

@article{arxiv.2507.14784,
  title  = {LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering},
  author = {Xinxin Dong and Baoyun Peng and Haokai Ma and Yufei Wang and Zixuan Dong and Fei Hu and Xiaodong Wang},
  journal= {arXiv preprint arXiv:2507.14784},
  year   = {2025}
}