世界并非单声道:大型音频语言模型的空间理解
声音
2026-05-12 v3 人工智能
摘要
大型音频语言模型在识别音频剪辑中出现的事物方面取得了快速进展,但空间音频语言理解仍缺乏清晰的任务界面。模型还必须决定声音事件发生的位置、哪些语义和空间属性属于同一个听觉对象、多个对象如何排列,以及场景级答案是否在物理上是合理的。我们将这种能力 formalized 为音频场景分析(audio scene analysis, ASA),是一个跨越原子感知、关系整合和认知推理三个层次的问题。我们提出了世界并非单声道(The World is Not Mono, TWNM)框架,为音频语言模型提供显式的空间证据。TWNM 使用基于物理的 First-Order Ambisonics(FOA)仿真进行可控监督,从多通道音频中学习插槽正规化的空间表示,将其与语义音频特征融合,并以渐进式课程训练,最终针对基于元数据推导的答案和辅助格式/证据奖励进行偏好优化。为 operationalize ASA,我们构建了一个受控基准,覆盖局部化、属性绑定、空间比较、场景推理和反事实推理。在该基准上,TWNM 实现了 70.8% 的总体准确率,66.4% 的空间家族任务准确率,以及 79.76% 的混合 L3 场景级多选问答准确率。我们还审计了单声道和双声道参考系统作为诊断参考,标明了显式审计标签,因为它们在空间输入、训练接口和输出格式方面存在差异。我们的主要论点是,明确定义的 ASA 层次结构、FOA 条件化的空间表示以及以元数据为基础的训练,使我们能够实现受控、可审计的空间音频语言推理,STARSS23 提供了有限的真实录制诊断。
引用
@article{arxiv.2601.02954,
title = {The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models},
author = {Yuhuan You and Lai Wei and Xihong Wu and Tianshu Qu},
journal= {arXiv preprint arXiv:2601.02954},
year = {2026}
}
备注
25 pages, 4 figures