BAT:利用大型语言模型学习空间声音推理
音频与语音处理
2025-05-20 v3 人工智能
计算与语言
声音
摘要
空间声音推理是一项基本的人类技能,使我们能够根据声音导航和解读周围环境。在本文中,我们提出 BAT,它将双耳声学场景分析模型的空间声音感知能力与大型语言模型(LLM)的自然语言推理能力相结合,以复现这种先天能力。为解决缺乏真实场景空间声音数据集的问题,我们使用 AudioSet 和 SoundSpaces 2.0 合成了一个双耳音频数据集。接着,我们开发了 SpatialSoundQA,一个基于空间声音的问答数据集,提供一系列问答任务,用于训练 BAT 在空间声音感知和推理的各个方面。BAT 的声学前端编码器是一种新颖的空间音频编码器,名为空间音频频谱图变换器(Spatial-AST),它本身在声音事件检测、空间定位和距离估计方面就表现出强大的性能。通过将 Spatial-AST 与 LLaMA-2 7B 模型集成,BAT 超越了标准的声音事件定位与检测(SELD)任务,使模型能够推理其环境中声音之间的关系。我们的实验证明了 BAT 在空间声音感知和推理方面的卓越性能,展示了大型语言模型在导航和解读复杂空间音频环境方面的巨大潜力。
引用
@article{arxiv.2402.01591,
title = {BAT: Learning to Reason about Spatial Sounds with Large Language Models},
author = {Zhisheng Zheng and Puyuan Peng and Ziyang Ma and Xie Chen and Eunsol Choi and David Harwath},
journal= {arXiv preprint arXiv:2402.01591},
year = {2025}
}
备注
Accepted to ICML 2024. Our demo, dataset, code and model weights are available at: https://zhishengzheng.com/bat