中文

VidComposition:多模态大语言模型能否分析编译视频中的构图?

计算机视觉与模式识别 2025-11-26 v5 人工智能

摘要

多模态大语言模型(MLLMs)的进步推动了多模态理解的显著进展,扩展了它们分析视频内容的能力。然而,现有的 MLLMs 评估基准主要关注抽象视频理解,缺乏对其理解视频构图能力的详细评估,即对视觉元素如何在高度编译的视频上下文中组合和交互的细致解读。我们引入了 VidComposition,这是一个新基准,专门设计用于通过精心策划的编译视频和电影级标注来评估 MLLMs 的视频构图理解能力。VidComposition 包含 982 个视频和 1706 道多项选择题,涵盖各种构图方面,如摄像机运动、角度、镜头尺寸、叙事结构、角色动作和情感等。我们对 33 个开源和专有 MLLMs 的全面评估揭示了人类与模型能力之间的显著性能差距。这突显了当前 MLLMs 在理解复杂编译视频构图方面的局限性,并为进一步改进提供了见解。排行榜和评估代码可在 https://yunlong10.github.io/VidComposition/ 获取。

关键词

引用

@article{arxiv.2411.10979,
  title  = {VidComposition: Can MLLMs Analyze Compositions in Compiled Videos?},
  author = {Yolo Y. Tang and Junjia Guo and Hang Hua and Susan Liang and Mingqian Feng and Xinyang Li and Rui Mao and Chao Huang and Jing Bi and Zeliang Zhang and Pooyan Fazli and Chenliang Xu},
  journal= {arXiv preprint arXiv:2411.10979},
  year   = {2025}
}

备注

Accepted to CVPR 2025