中文

v-HUB:一个基于视觉与声音的视频幽默理解基准

计算机视觉与模式识别 2026-03-11 v2 人工智能 计算与语言

摘要

能够理解幽默的AI模型具有现实世界的应用前景——例如,增强人机交互中的参与感。为了衡量和诊断多模态大语言模型(MLLMs)的幽默理解能力,我们引入了v-HUB,一个新颖的视频幽默理解基准。v-HUB包含一个精心策划的非语言短视频集合,反映了仅通过视觉线索即可欣赏幽默的真实世界场景。我们为每个视频片段配对了丰富的标注,以支持多种评估任务和分析,包括一项关于环境声音如何增强幽默感的新颖研究。为了拓宽其适用性,我们构建了一个开放式问答任务,使v-HUB能够轻松集成到现有的视频理解任务套件中。我们评估了多种多样的MLLMs,从专门的Video-LLMs到能够原生处理音频的通用OmniLLMs,覆盖了开源和闭源领域。实验结果揭示了MLLMs在仅凭视觉线索理解幽默方面所面临的困难。我们的发现还表明,融入音频有助于视频幽默理解,凸显了整合更丰富模态以处理复杂视频理解任务的潜力。

关键词

引用

@article{arxiv.2509.25773,
  title  = {v-HUB: A Benchmark for Video Humor Understanding from Vision and Sound},
  author = {Zhengpeng Shi and Yanpeng Zhao and Jianqun Zhou and Yuxuan Wang and Qinrong Cui and Wei Bi and Songchun Zhu and Bo Zhao and Zilong Zheng},
  journal= {arXiv preprint arXiv:2509.25773},
  year   = {2026}
}

备注

24 pages, 9 figures