中文

语义与视觉证据:为高效长视频推理提供证据——HD-EPIC VQA 挑战解决方案

计算机视觉与模式识别 2026-05-29 v1 人工智能

摘要

由于上下文长度有限和细粒度视觉细节的缺乏 grounding,理解长形式第三人称视频仍然是多模态大语言模型(MLLM)面临的挑战。最近提出的 HD-EPIC 基准凸显了这些局限性:即使是强大的长上下文模型在多样化的视频问答任务中也取得了相对较低的性能。本文提出了一个统一框架,将长视频推理解耦为两种互补的证据形式:语义证据和视觉证据。语义证据通过粗到细提取管道捕获全局程序结构,而以目标为中心的视觉证据则通过边界框和视觉嵌入保留细粒度的 grounding。在推理期间,我们将推理形式化为查询条件化的证据检索和集成过程,动态从两种来源中选择相关信息。我们的方法在 HD-EPIC-VQA 挑战中实现了多个任务类别的竞争性能。更广泛地说,我们的结果表明,显式地结构化、检索和集成语义与视觉证据对于使用 MLLM 有效地进行长视频理解至关重要。

关键词

引用

@article{arxiv.2605.29402,
  title  = {Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge},
  author = {Yinsong Xu and Wei Jing and Liuxin Zhang and Wanjun Lv and Hui Li},
  journal= {arXiv preprint arXiv:2605.29402},
  year   = {2026}
}