中文

VoiceGiraffe:面向极长上下文音频语言理解的基准

声音 2026-05-28 v1

摘要

虽然大型音频语言模型(LALMs)在音频处理方面取得了显著进展,规模为秒级或分钟级,但在小时级音频理解方面仍是一个根本性瓶颈。现有基准主要依赖短片段或人工拼接的片段,无法真实评估 LALMs 在实际场景(如播客和冗长演讲)中进行长程信息理解的能力。为此,我们引入 VoiceGiraffe,一个旨在严格评估 LALMs 在多样化现实场景、模态和语言下的长上下文设置下的能力的新基准。它包含 1500 个精选的三元组,结构为单跳感知与多跳推理的双层分类法。我们对广泛的开源和专有 LALMs进行人类性能评估。结果凸显了三个根本性发现。首先,VoiceGiraffe 仍然具有挑战性,距离饱和仍很远。其次,我们表明没有单一推理范式在普遍上占据优势。端到端推理有利于具备原生长上下文音频理解能力的模型,级联字幕聚合稳定了被小时级音频压倒的小型模型,而增强推理的级联联动与外部大型语言模型结合有助于较弱的模型,但可能成为较强的专有系统的瓶颈。第三,我们揭示了长程记忆持久性是一个关键瓶颈。LALMs 在回答需要连接关键因果线索的问题上优于需要在长音频中持续跟踪稀疏事件的问题,而人类则恰恰相反。这些发现将 VoiceGiraffe 定位为长篇音频理解的具有挑战性和诊断性测试场,凸显了需要具备持久记忆和稳健长程聚合能力的 LALMs的需求。

关键词

引用

@article{arxiv.2605.27976,
  title  = {VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding},
  author = {Jashin Ye and Dongxiao Wang and Yixuan Ye and Sashuai Zhou and Weihuang Lin and Mingyang Han and Kunpeng Wang and Zeyu Yuan and Boyu Li and Haoxiang Shi and Jingchen Shu and Jun Song and Bo Zheng},
  journal= {arXiv preprint arXiv:2605.27976},
  year   = {2026}
}

备注

Benchmark Project: https://github.com/LivingFutureLab/VoiceGiraffe