SPUR:将空间音频理解与推理集成到大型音频语言模型中的即插即用框架
音频与语音处理
2025-11-17 v2 人工智能
摘要
空间感知是听觉智能的核心,能够实现对真实声学场景的准确理解,并促进对周围世界的人类级感知。虽然最近的大型音频语言模型 (LALM) 在复杂音频推理方面表现出色,但大多数 operates on monaural inputs 且缺乏捕获空间线索(如方向、高度和距离)的能力。我们引入 SPUR,一种轻量级、即插即用的方法,通过最小的架构更改为 LALMs 提供空间感知。SPUR 包括:(i) 将 (W, X, Y, Z) 通道映射到旋转感知、以听者为中心的空间特征的 First-Order Ambisonics (FOA) 编码器,通过多模态适配器集成到目标 LALMs 中;以及 (ii) SPUR-Set,一个空间 QA 数据集,组合开源 FOA 录音与受控模拟,强调相对方向、高度、距离和重叠,用于监督式空间推理。我们在 SPUR-Set 上对模型进行微调,持续改进空间 QA 和多说人指派,同时保持一般音频理解。SPUR 提供了一个将 monaural LALMs 转换为具备空间感知能力的模型的简单配方。广泛的消融实验验证了我们方法的有效性。
引用
@article{arxiv.2511.06606,
title = {SPUR: A Plug-and-Play Framework for Integrating Spatial Audio Understanding and Reasoning into Large Audio-Language Models},
author = {S Sakshi and Vaibhavi Lokegaonkar and Neil Zhang and Ramani Duraiswami and Sreyan Ghosh and Dinesh Manocha and Lie Lu},
journal= {arXiv preprint arXiv:2511.06606},
year = {2025}
}
备注
Project: https://sakshi113.github.io/spur/