中文

BLAB: 残酷长音频基准测试

人工智能 2025-05-14 v2 计算与语言 声音 音频与语音处理

摘要

开发能够理解多样化口语交互的大型音频语言模型(LMs)对于适应人类交流的多模态本质至关重要,并且可以提高语言技术在不同用户群体中的可及性。近期关于音频LMs的研究主要在短音频片段(通常不超过30秒)上评估其性能,对更能反映用户自然交互的长形式对话语音片段的探索有限。我们提出了残酷长音频基准测试(BLAB),这是一个具有挑战性的长形式音频基准,通过平均长度为51分钟的音频片段评估音频LMs在定位、时长估计、情感和计数任务上的表现。BLAB包含833小时以上的多样化完整音频片段,每个片段都配有人工标注的基于文本的自然语言问答。我们的音频数据来自宽松许可的来源,并经过人工辅助筛选过程以确保任务合规。我们在BLAB上评估了六个开源和专有音频LMs,发现所有模型(包括Gemini 2.0 Pro和GPT-4o等先进模型)在BLAB的任务上均表现不佳。我们的全面分析揭示了任务难度与音频时长之间的关键权衡关系。一般来说,我们发现音频LMs在长形式语音上存在困难,性能随时长增加而下降。它们在定位、时间推理和计数方面表现不佳,并且难以理解非音素信息,更多依赖提示而非音频内容。BLAB作为一个具有挑战性的评估框架,旨在开发具有稳健长形式音频理解能力的音频LMs。

关键词

引用

@article{arxiv.2505.03054,
  title  = {BLAB: Brutally Long Audio Bench},
  author = {Orevaoghene Ahia and Martijn Bartelds and Kabir Ahuja and Hila Gonen and Valentin Hofmann and Siddhant Arora and Shuyue Stella Li and Vishal Puttagunta and Mofetoluwa Adeyemi and Charishma Buchireddy and Ben Walls and Noah Bennett and Shinji Watanabe and Noah A. Smith and Yulia Tsvetkov and Sachin Kumar},
  journal= {arXiv preprint arXiv:2505.03054},
  year   = {2025}
}