LongVideoAgent: 基于多智能体推理的长视频理解
人工智能
2025-12-24 v1 计算机视觉与模式识别
机器学习
多智能体系统
摘要
多模态大语言模型及使用工具进行长视频问答的系统的最新进展,展示了理解长达一小时视频内容的潜力。然而,许多方法仍将内容压缩为有损摘要,或依赖有限的工具集,这削弱了时间定位能力并遗漏了细粒度线索。我们提出了一种多智能体框架,其中主控大语言模型协调一个定位智能体来定位与问题相关的片段,以及一个视觉智能体来提取目标文本观察。主控智能体在步数限制下进行规划,并通过强化学习训练,以鼓励简洁、正确且高效的多智能体协作。这种设计帮助主控智能体通过定位聚焦于相关片段,用视觉细节补充字幕,并产生可解释的轨迹。在我们提出的 LongTVQA 和 LongTVQA+(从 TVQA/TVQA+ 聚合的剧集级数据集)上,我们的多智能体系统显著优于强大的非智能体基线。实验还表明,强化学习进一步增强了训练后智能体的推理和规划能力。代码和数据将在 https://longvideoagent.github.io/ 上共享。
引用
@article{arxiv.2512.20618,
title = {LongVideoAgent: Multi-Agent Reasoning with Long Videos},
author = {Runtao Liu and Ziyi Liu and Jiaqi Tang and Yue Ma and Renjie Pi and Jipeng Zhang and Qifeng Chen},
journal= {arXiv preprint arXiv:2512.20618},
year = {2025}
}