中文

LVOmniBench:面向 Omnimodal LLMs 的长音视频理解评估基准

计算机视觉与模式识别 2026-03-20 v1

摘要

近期的多模态大语言模型(OmniLLMs)在理解音频和视频输入方面取得了显著进展。然而,当前的评估主要聚焦于持续时间为10秒至5分钟的短音频和视频片段,未能反映真实世界应用中视频通常持续数十分钟的需求。为此,我们引入 LVOmniBench,一个专为跨模态理解长音频和视频设计的新基准。该数据集包含来自开放平台的高质量视频,具有丰富的音视频动态。通过严格的人工筛选和标注,LVOmniBench 包含275个视频,时长从10分钟到90分钟不等,包含1014个问答(QA)对。LVOmniBench 旨在全面评估 OmniLLMs 在包括长期记忆、时序定位、细粒度理解和多模态感知在内的多个领域的能力。我们的广泛评估显示,当前的 OmniLLMs 在处理扩展音视频输入时面临重大挑战。开源模型通常准确率低于35%,而 Gemini 3 Pro 可达约65%的峰值准确率。我们预计,该数据集及我们的实证发现将激励进一步的研究和开发,致力于解决在长音视频语境中解决复杂跨模态理解问题的能力。

关键词

引用

@article{arxiv.2603.19217,
  title  = {LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs},
  author = {Keda Tao and Yuhua Zheng and Jia Xu and Wenjie Du and Kele Shao and Hesong Wang and Xueyi Chen and Xin Jin and Junhan Zhu and Bohan Yu and Weiqiang Wang and Jian Liu and Can Qin and Yulun Zhang and Ming-Hsuan Yang and Huan Wang},
  journal= {arXiv preprint arXiv:2603.19217},
  year   = {2026}
}

备注

Project page: https://kd-tao.github.io/LVOmniBench/