中文

VideoAesBench:评估大型多模态模型视频审美感知能力的基准

计算机视觉与模式识别 2026-02-03 v2

摘要

大型多模态模型(LMM)在各种视觉感知任务中已显示出卓越的能力,这随后使得对LMM的评估变得重要。然而,视频审美质量评估这一人类基本能力,对于LMM而言尚未得到充分探索。为此,我们引入VideoAesBench,一个用于评估LMM理解视频审美质量的全面基准。VideoAesBench具有若干显著特征:(1)多样化内容,包括来自多个视频来源的用户生成(UGC)、AI 生成(AIGC)、压缩、机器人生成(RGC)和游戏视频的1804个视频。(2)多种问题格式,包含传统单选问题、多选问题、真假问题,以及 novel 的开放式问题,用于视频审美描述。(3)全面视频审美维度,包括视觉形式相关问题的5个方面、视觉风格相关问题的4个方面,以及视觉情感问题的3个方面。基于VideoAesBench,我们对23个开源和商业大型多模态模型进行基准测试。我们的发现表明,当前LMM仅具备基本的视频审美感知能力,其性能仍不完整且不精确。我们希望VideoAesBench可作为强大的测试平台,并为可解释的视频审美评估提供洞见。数据将发布在 https://github.com/michaelliyunhao/VideoAesBench。

关键词

引用

@article{arxiv.2601.21915,
  title  = {VideoAesBench: Benchmarking the Video Aesthetics Perception Capabilities of Large Multimodal Models},
  author = {Yunhao Li and Sijing Wu and Zhilin Gao and Zicheng Zhang and Qi Jia and Huiyu Duan and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2601.21915},
  year   = {2026}
}