VEBench:面向真实世界视频编辑的大型多模态模型基准测试
计算机视觉与模式识别
2026-05-12 v2
摘要
真实世界的视频编辑不仅需要电影技巧方面的专业知识,还需要多模态推理来选择、对齐和组合素材以形成连贯的叙事。虽然近期的大型多模态模型(LMM)在通用视频理解方面显示出显著进展,但其在多视频推理和操作编辑工作流程方面的能力仍基本未被探索。我们介绍VEBENCH,第一个全面评估现实视频编辑场景下编辑知识理解与操作推理能力的基准测试。VEBENCH包含3.9K个高质量编辑后的视频(超过257小时)和3,080个人类验证的QA对,通过三轮人机协作标注管道构建,确保精确的时间标签和语义一致性。它包含两个互补的QA任务:1)视频编辑技巧识别,评估模型识别7种编辑技巧的多模态线索能力;2)视频编辑操作模拟,建模真实世界的编辑工作流程,需要从多个备选素材中选择并进行时间局部化。对专有(如Gemini-2.5-Pro)和开源LMM进行大规模实验,揭示了当前模型性能与人类级编辑认知之间存在显著鸿沟。这些结果凸显了迫切需要将视频理解与创意操作推理相结合的紧迫性。我们设想VEBENCH将为推动智能视频编辑系统的发展以及引领复杂推理研究的未来方向奠定基础。
引用
@article{arxiv.2605.03276,
title = {VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing},
author = {Andong Deng and Dawei Du and Zhenfang Chen and Wen Zhong and Fan Chen and Guang Chen and Chia-Wen Kuo and Longyin Wen and Chen Chen and Sijie Zhu},
journal= {arXiv preprint arXiv:2605.03276},
year = {2026}
}
备注
CVPR Findings 2026