面向多视频理解的技能增强代理框架与基准
计算机视觉与模式识别
2026-03-17 v1
摘要
多模态大型语言模型在单视频理解方面取得了强大的性能,但其在跨视频推理能力仍受限。现有方法通常将多个视频拼接为单个输入进行直接推理,导致训练-推理不匹配、帧压缩信息损失,以及缺乏显式跨视频协调。与此同时,当前的多视频基准主要强调事件级比较,-identity 级匹配、细粒度判别以及结构化多步骤推理的探索不足。为此,我们引入 MVX-Bench,一个多视频跨维度基准,将 11 项经典计算机视觉任务 reformulate 为统一的多视频问答框架,包含 1,442 个问题涵盖 4,255 个来自多样真实数据集的视频。我们进一步提出 SAMA,一个用于多视频理解的技能增强代理框架,集成视觉工具、任务特定技能和冲突感知验证机制,以实现迭代和结构化推理。实验结果表明,SAMA 在 MVX-Bench 上超越了强大的开源基线和 GPT,消融实验验证了技能设计和冲突解决的有效性。
引用
@article{arxiv.2603.14733,
title = {A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding},
author = {Yue Zhang and Liqiang Jing and Jia Li and Yapeng Tian and Xinya Du and Yunhui Guo and Vibhav Gogate},
journal= {arXiv preprint arXiv:2603.14733},
year = {2026}
}