SVAgent:基于跨模态多智能体协作的剧情引导长视频理解
计算机视觉与模式识别
2026-04-08 v1
摘要
视频问答(VideoQA)是一个需要整合空间、时间和语义信息以捕捉视频序列复杂动态的具有挑战性的任务。虽然近期进展引入了各种方法进行视频理解,但大多数现有方法仍依赖定位相关帧来回答问题,而不是像人类一样通过演变的剧情进行推理。人类自然地通过连贯的剧情来解释视频,这一能力对于做出稳健且在上下文中得到 grounding 的预测至关重要。为此,我们提出了 SVAgent,一个剧情引导的跨模态多智能体框架,用于 VideoQA。剧情智能体基于由细化建议智能体分析历史失败后提出的帧来逐步构建叙事表示。此外,跨模态决策智能体在演变的剧情的指导下,独立地从视觉和文本模态中预测答案。它们的输出然后由元智能体评估,以对齐跨模态预测并增强推理鲁健性和答案一致性。实验结果表明,SVAgent 通过模拟人类类故事推理在视频理解中实现了卓越的性能和可解释性。
引用
@article{arxiv.2604.05079,
title = {SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration},
author = {Zhongyu Yang and Zuhao Yang and Shuo Zhan and Tan Yue and Wei Pang and Yingfang Yuan},
journal= {arXiv preprint arXiv:2604.05079},
year = {2026}
}
备注
Published in CVPR2026