中文

HumanVBench:用于探索MLLM中人类中心视频理解的自动合成基准

计算机视觉与模式识别 2026-04-14 v3 人工智能

摘要

评估多模态大语言模型(MLLMs)中人类中心视频理解的细粒度能力 remains a great challenge,因为现有基准往往忽视情感、行为以及跨模态对齐的细微差别。我们引入 HumanVBench,一个全面的视频基准,旨在严格探索这些能力,覆盖 16 个细粒度任务。我们工作的核心是一种新颖且可扩展的基准构建方法,包含两个自动化管道,用于合成高质量的视频注释和具有挑战性的多选问题,同时最小化人工劳动。通过利用最先进的模型进行注释,并系统性地将由模型引起的错误转换为合理的干扰项,我们的框架为创建细粒度评估套件提供了通用方法。我们对 30 个领先的 MLLMs 在 HumanVBench 上的广泛评估揭示了关键不足,尤其是在感知细微情感和将 speech 与视觉线索对齐方面,即使是顶尖的专有模型也未能达到人类的水平。我们开源 HumanVBench 及我们的合成管道,以催化更具社会智能和能力的视频 MLLMs 的发展。

关键词

引用

@article{arxiv.2412.17574,
  title  = {HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks},
  author = {Ting Zhou and Daoyuan Chen and Qirui Jiao and Bolin Ding and Yaliang Li and Ying Shen},
  journal= {arXiv preprint arXiv:2412.17574},
  year   = {2026}
}

备注

Accepted as a conference paper at CVPR 2026