MR. 视频:面向长视频理解的 MapReduce 原理
计算机视觉与模式识别
2025-04-23 v1
摘要
我们提出 MR. Video,一个基于代理的长视频理解框架,展示了处理长视频的简单而有效的 MapReduce 原理:(1) Map:独立且稠密地感知短视频片段;(2) Reduce:联合聚合来自所有片段的信息。与序列到序列视觉语言模型 (VLM) 相比,MR. Video 在不受上下文长度限制的情况下进行详细的短视频感知。与通常依赖顺序关键片段选择的现有视频代理相比,Map 操作实现了对短视频片段的更简单和更可扩展的并行感知。其 Reduce 步骤允许更全面的上下文聚合和推理,超越了显式的关键片段检索。该 MapReduce 原理适用于 VLM 和视频代理,我们使用 LLM 代理来验证其有效性。实际中,MR. Video 采用两个 MapReduce 阶段:(A) 标述:为短视频片段生成标述 (map),然后将重复的字符和对象标准化为共享名称 (reduce);(B) 分析:针对每个用户问题,从 individual short videos 中分析相关信息 (map),并整合为最终答案 (reduce)。在具有挑战性的 LVBench 上,MR. Video 相较于最先进的 VLM 和视频代理实现了超过 10% 的准确率提升。代码已公开:https://github.com/ziqipang/MR-Video
引用
@article{arxiv.2504.16082,
title = {MR. Video: "MapReduce" is the Principle for Long Video Understanding},
author = {Ziqi Pang and Yu-Xiong Wang},
journal= {arXiv preprint arXiv:2504.16082},
year = {2025}
}
备注
Preprint