中文

MAVEN:面向视频推理任务的多阶段智能标注管线

计算机视觉与模式识别 2026-05-22 v1 人工智能

摘要

为Vision Language Models(VLM)训练视频事件推理需要高质量结构化标注,既要捕捉事件发生的“什么”、“何时”、“何处”、“为何”以及“有什么后果”,又要规模突破手动标注的限制。我们提出MAVEN(Multi-stage Agentic Video Event aNnotation),一个将原始视频转化为多任务训练数据的多阶段智能管线,其Chain-of-Thought(CoT)推理痕迹围绕指定的“聚焦事件”组织。其核心是从三个互补的caption层级综合生成Multi-Scale Spatio-Temporal Event Description(MSTED),该显式中间表示作为下游Q&A生成的唯一输入,覆盖多个任务格式。关键的是,MAVEN支持agent驱动的领域适应:给定新的视频数据集和目标问题示例,agent无需人工重新设计即可重新设计所有提示。层次化精炼循环进一步对标注错误进行分类,追溯到产生管道阶段的根本原因,并应用针对性修改,重写提示或修改管道结构,以迭代提高数据质量。我们将MAVEN应用于对5300多个交通视频进行标注,并在生成的data上微调Cosmos-Reason2-8B。在私有CCTV评估集上,微调模型超越了Gemini 2.5 Pro和3.1 Flash,包括在MCQ准确率上实现了+38.8分的零样本提升。在AccidentBench上,仅用CCTV训练的Cosmos-Reason2提升了+10.7分的MCQ分数,甚至在未见dashcam视频的情况下匹配了Gemini 2.5 Pro;加入agent适配的dashcam标注后,差距缩小至与Gemini 3.1 Flash持平,进一步通过RL后训练将整体性能提升至超越两个Gemini基准。定性结果表明,agent化工作流程轻松适应新的领域,从仓库监控和公共安全视频中均显示出管道的灵活适应能力。

关键词

引用

@article{arxiv.2605.21917,
  title  = {MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks},
  author = {Han Zhang and Wanting Jiang and Tomasz Kornuta and Tian Zheng and Vidya Murali},
  journal= {arXiv preprint arXiv:2605.21917},
  year   = {2026}
}

备注

CVPR 2026 Workshop