中文

大型音频语言模型能否良好理解音频?面向LALMs的语音、场景与事件理解基准

声音 2026-02-16 v3

摘要

最近,大型音频语言模型(LALM)取得了快速的进展,展示了其在通过跨模态集成方面对音频理解具有强大的效能。为了评估LALM的音频理解性能,研究者提出了不同的方法。然而,针对实际交互的关键方面在现有基准中仍有不足,即音频信号通常包含语音和非语音成分,其能量水平在不同情景下会有显著差异。此外,大多数基准也不考虑同一音频剪辑中语音、场景和事件的联合理解。在本工作中,我们引入SSEU-Bench,这是第一个显式考虑语音与非语音音频能量差异的多功能音频理解基准,包含语音、场景和事件的独立与联合理解设置。此外,我们展示了一些LALM在联合理解设置下的某些任务表现不佳。为此,我们引入链式思维(CoT),通过将复杂任务分解为更简单的推理步骤,有效提高了LALM的联合音频理解性能。

关键词

引用

@article{arxiv.2509.13148,
  title  = {Can Large Audio Language Models Understand Audio Well? Speech, Scene and Events Understanding Benchmark for LALMs},
  author = {Han Yin and Jung-Woo Choi},
  journal= {arXiv preprint arXiv:2509.13148},
  year   = {2026}
}

备注

Accepted by ICASSP 2026