WoW-Bench:通过海洋哺乳动物鸣叫评估音频语言模型的细粒度声学感知
声音
2025-08-29 v1 人工智能
音频与语音处理
摘要
大型音频语言模型(LALMs)将语言理解扩展到听觉域,但其进行低级聆听(如音调和持续时间检测)的能力尚未得到充分探索。然而,低级聆听对于实施世界各地、超出分布的任务至关重要,因为模型必须基于细粒度的声学线索对陌生声响进行推理。为此,我们引入 World-of-Whale 基准测试(WoW-Bench),用于使用海洋哺乳动物鸣叫评估低级听觉感知和认知。WoW-bench 包含用于对新声响进行分类的感知基准测试,以及受 Bloom 的分类学启发的认知基准测试,以评估模型记忆、理解、应用和分析声响事件的能力。对于认知基准测试,我们额外引入干扰问题,以评估模型是否通过聆听来解决问题,而不仅仅是依赖其他启发式方法。使用最先进的 LALMs 进行实验显示,其性能远低于人类水平,这表明 LALMs 中仍需更强的听觉 grounding。
引用
@article{arxiv.2508.20976,
title = {WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations},
author = {Jaeyeon Kim and Heeseung Yun and Sang Hoon Woo and Chao-Han Huck Yang and Gunhee Kim},
journal= {arXiv preprint arXiv:2508.20976},
year = {2025}
}
备注
Preprint. Project page: https://jaeyeonkim99.github.io/wow_bench/