See, Hear, and Understand:面向多模态大语言模型的听觉人类语音理解基准测试
计算机视觉与模式识别
2026-04-13 v2 人工智能
机器学习
摘要
多模态大语言模型(MLLM)预期联合解读视觉、音频和语言信息,但现有视频基准测试很少评估关于人类语音的细粒度推理。许多任务在视觉上可解或仅粗略评估语音,难以洞察模型是否能对齐说话者、所说内容以及发生时间。我们引入AV-SpeakerBench,一个聚焦于真实视频中以说话者为中心的听觉人类语音理解的多选题基准测试,包含3,212个问题。其特点包括:(1)以说话者为中心的表述,将说话者而非场景作为核心推理单元;(2)融合导向的问题设计,将听觉和视觉依赖性嵌入问题语义中;(3)专家精选标注,确保时间精确性和跨模态有效性。全面评估显示,Gemini 系列始终优于开源系统,Gemini 2.5 Pro取得最佳成绩。在开源模型中,Qwen3-Omni-30B接近Gemini 2.0 Flash,但仍远逊于Gemini 2.5 Pro,主要由于听觉视觉融合能力较弱而非视觉感知能力不足。我们认为AV-SpeakerBench为未来多模态系统在细粒度听觉视觉推理方面奠定了严谨基础。
引用
@article{arxiv.2512.02231,
title = {See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models},
author = {Le Thien Phuc Nguyen and Zhuoran Yu and Samuel Low Yu Hang and Subin An and Jeongik Lee and Yohan Ban and SeungEun Chung and Thanh-Huy Nguyen and JuWan Maeng and Soochahn Lee and Yong Jae Lee},
journal= {arXiv preprint arXiv:2512.02231},
year = {2026}
}
备注
Findings of CVPR 2026