中文

VideoMind:用于时序关联视频推理的链式 LoRA 智能体

计算机视觉与模式识别 2026-02-24 v3 人工智能

摘要

视频因其独特的时间维度,要求精确的关联理解,答案直接链接到视觉、可解释的证据。尽管文本基准的大语言模型在推理方面取得了显著进展,但多模态推理——尤其是视频推理——仍有限。本文通过引入 VideoMind,一种用于时序关联视频推理的视频语言智能体来弥补这一差距。我们的方法包含两个关键创新:(1)我们识别了进行关联视频推理所必需的四项核心能力,提出一种基于角色的智能体工作流程,包括用于协调角色的计划者、用于时序事件定位的定位者、用于评估事件候选对象的验证者以及用于问答的回答者。(2)为高效集成这些角色于推理过程中,我们提出一种新的Chain-of-LoRA机制,利用带有多个 LoRA 适配器的统一基础模型,以实现无缝角色切换,在效率与灵活性之间取得平衡。广泛的实验在15个基准测试中完成,涵盖Grounded VideoQA、Video Temporal Grounding和 General VideoQA任务,证明了所提出方案在推进视频智能体、test-time scaling和长视频推理方面的有效性。代码、模型、数据集和演示已发布于https://videomind.github.io/。

关键词

引用

@article{arxiv.2503.13444,
  title  = {VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning},
  author = {Ye Liu and Kevin Qinghong Lin and Chang Wen Chen and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2503.13444},
  year   = {2026}
}

备注

ICLR 2026 Camera Ready