面向高效长视频推理的多智能体感知-行动联盟
计算机视觉与模式识别
2026-03-23 v3 多智能体系统
摘要
本文提出了一种用于高效长视频推理的多智能体感知-行动探索联盟,称为A4VL。A4VL在多轮感知-行动探索循环中运作,涉及多位视觉语言模型(VLM)智能体。在每一轮中,团队成员执行视频问答(VideoQA)任务,先进行感知探索,再进行行动探索。在感知探索阶段,每个智能体学习从少量抽取的帧中提取与查询相关的感知线索,并进行基于线索的对齐,以寻找与查询相关事件最相关的视频片段。在行动探索阶段,A4VL依次进行三步视频推理:(1)每个智能体基于理由生成初始答案;(2)所有智能体通过交叉审阅和相关性排序对彼此进行评分;(3)基于是否达到令人满意的共识,决定是通过修剪(例如过滤掉表现最差的智能体)和重排(例如基于新线索与匹配块进行感知-行动探索)开启新的感知-行动 deliberation 轮次,还是终止并生成最终答案。通过多轮感知-行动探索集成的多智能体联盟,结合事件驱动的分区和线索引导的块对齐,使A4VL能够有效应对实际场景中的长视频,同时保持高质量的视频推理。在五个流行VideoQA基准测试上的评估结果表明,A4VL超越了18个现有代表性VLM和11个专为长视频推理优化的最新方法,同时实现了显著更低的推理延迟。我们的代码已发布于https://github.com/git-disl/A4VL。
引用
@article{arxiv.2603.14052,
title = {A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning},
author = {Yichang Xu and Gaowen Liu and Ramana Rao Kompella and Tiansheng Huang and Sihao Hu and Fatih Ilhan and Selim Furkan Tekin and Zachary Yahn and Ling Liu},
journal= {arXiv preprint arXiv:2603.14052},
year = {2026}
}
备注
Accepted by CVPR2026