SCENEBench:基于助听与工业应用场景的音频理解基准
声音
2026-03-11 v1 人工智能
摘要
大语言模型(LLM)的进展已在音频处理方面实现重大突破,导致现今已知的领先模型被称为大型音频语言模型(LALM)。然而,针对自动语音识别(ASR)之外的音频理解进行评估的工作仍有限。本文提出了一套基准测试套组 SCENEBench(Spatial, Cross-lingual, Environmental, Non-speech Evaluation),旨在覆盖广泛的音频理解能力,分为四个真实世界场景:背景声理解、噪声定位、跨语言语音理解和声音特征识别。这四个类别基于无障碍技术和工业噪声监控中的未充分研究需求而选取。除性能指标外,本文还测量了模型延迟。SCENEBench 旨在评估不仅关注音频中说了什么——更关注语音的说法方式以及音频的非语音成分。由于本基准测试中的音频样本是人工合成构造的(例如,通过叠加两个自然音频样本),因此我们进一步针对每个任务的 20 条自然音频项目进行验证,从现有数据集中抽样以匹配我们的任务要求,以评估生态有效性。我们评估了五个领先的 LALMs,发现关键差距:在不同任务上的表现差异很大,部分任务的准确率甚至低于随机猜测,而另一些任务则实现了高准确率。这些结果为模型能力的有针对性的改进提供了方向。
引用
@article{arxiv.2603.09853,
title = {SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases},
author = {Laya Iyer and Angelina Wang and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2603.09853},
year = {2026}
}
备注
Accepted to EACL 2026 (Main Conference). 10 pages, 10 figures. Camera-ready version