中文

WoW-Bench:通过海洋哺乳动物鸣叫评估音频语言模型的细粒度声学感知

声音 2025-08-29 v1 人工智能 音频与语音处理

摘要

大型音频语言模型(LALMs)将语言理解扩展到听觉域,但其进行低级聆听(如音调和持续时间检测)的能力尚未得到充分探索。然而,低级聆听对于实施世界各地、超出分布的任务至关重要,因为模型必须基于细粒度的声学线索对陌生声响进行推理。为此,我们引入 World-of-Whale 基准测试(WoW-Bench),用于使用海洋哺乳动物鸣叫评估低级听觉感知和认知。WoW-bench 包含用于对新声响进行分类的感知基准测试,以及受 Bloom 的分类学启发的认知基准测试,以评估模型记忆、理解、应用和分析声响事件的能力。对于认知基准测试,我们额外引入干扰问题,以评估模型是否通过聆听来解决问题,而不仅仅是依赖其他启发式方法。使用最先进的 LALMs 进行实验显示,其性能远低于人类水平,这表明 LALMs 中仍需更强的听觉 grounding。

关键词

引用

@article{arxiv.2508.20976,
  title  = {WoW-Bench: Evaluating Fine-Grained Acoustic Perception in Audio-Language Models via Marine Mammal Vocalizations},
  author = {Jaeyeon Kim and Heeseung Yun and Sang Hoon Woo and Chao-Han Huck Yang and Gunhee Kim},
  journal= {arXiv preprint arXiv:2508.20976},
  year   = {2025}
}

备注

Preprint. Project page: https://jaeyeonkim99.github.io/wow_bench/