中文

VEU-Bench:面向视频编辑全面理解的基准

计算机视觉与模式识别 2025-04-28 v1 人工智能

摘要

互联网上广泛分享的视频往往经过编辑。尽管最近的视频大语言模型(Video Large Language Models, Vid-LLMs)在通用视频理解任务中取得了很大进展,但其在视频编辑理解(Video Editing Understanding, VEU)任务方面的能力仍未得到探索。为填补这一空白,本文介绍VEU-Bench(Video Editing Understanding Benchmark),一个全面的基准,涵盖从帧内特征(如镜头尺寸)到帧间属性(如剪辑类型和转场)等多个维度的视频编辑成分。与之前专注于编辑元素分类的视频编辑理解基准不同,VEU-Bench涵盖19项细粒度任务,分为三个阶段:识别、推理和判断。为提高VUv的自动标注质量,我们构建了一个集成本体知识库的标注管道。通过对11个最先进(SOTA)Vid-LLMs进行大量实验,我们发现当前Vid-LLMs在VEU任务中面临重大挑战,部分模型的表现甚至低于随机选择。为缓解此问题,我们开发了Oscars,一款在精选VEU-Bench数据集上微调的VEU专家模型。它在VEU-Bench上的准确率比现有开源Vid-LLMs提高了28.3%,性能与商业模型如GPT-4o相当。我们还展示了整合VEU数据显著提升Vid-LLMs在通用视频理解基准上的性能,平均提升了9个推理任务中的8.3%。

关键词

引用

@article{arxiv.2504.17828,
  title  = {VEU-Bench: Towards Comprehensive Understanding of Video Editing},
  author = {Bozheng Li and Yongliang Wu and Yi Lu and Jiashuo Yu and Licheng Tang and Jiawang Cao and Wenqing Zhu and Yuyang Sun and Jay Wu and Wenbo Zhu},
  journal= {arXiv preprint arXiv:2504.17828},
  year   = {2025}
}

备注

Accepted to CVPR2025