中文

MUPA:面向 grounding 视频问答的多路径代理推理

计算机视觉与模式识别 2025-06-30 v2 人工智能

摘要

grounding 视频问答需要将文本答案与明确的视觉证据对齐。然而,现代多模态模型通常依赖语言先验和不恰当的相关性,导致缺乏 grounding 的预测。本文提出 MUPA,一种合作的 MUlti-Path Agentic 方法,通过统一视频 grounding、问答、答案反思和聚合来解决 grounding 视频问答问题。MUPA 包含三个在 grounding 和 QA 代理之间不同时间顺序下的互动的不同推理路径,以及一个专门的反思代理,用于判断和聚合多路径结果,以实现一致的 QA 和 grounding。该设计显著提高了 grounding 的忠实性而不牺牲答案的准确性。尽管仅使用 20 亿参数,本方法就已超越了所有 70 亿规模的竞争者。当扩展到 70 亿参数时,MUPA 取得了新的最先进成绩,在 NExT-GQA 和 DeVE-QA 上的 Acc@GQA 分别达到 30.3% 和 47.4%,证明了 MUPA 在可信赖的视频语言理解方面的有效性。我们的代码可在 https://github.com/longmalongma/MUPA 获取。

关键词

引用

@article{arxiv.2506.18071,
  title  = {MUPA: Towards Multi-Path Agentic Reasoning for Grounded Video Question Answering},
  author = {Jisheng Dang and Huilin Song and Junbin Xiao and Bimei Wang and Han Peng and Haoxuan Li and Xun Yang and Meng Wang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2506.18071},
  year   = {2025}
}