GRAM:面向真实环境的空间通用音频表示
声音
2026-02-05 v2
摘要
音频基础模型学习通用音频表示,以支持广泛的下游任务。虽然这些模型在针对常规单通道、干燥音频片段的性能取得了显著提升,但在具有回声和噪声的真实环境中却有限。此外,大多数音频基础模型忽略了真实环境声学空间维度,这排除了涉及声音定位的任务。为此,我们提出了GRAM:一个在多通道掩码自编码器中高效学习空间音频表示的通用真实环境音频模型。我们以标准化方式评估了GRAM和其他音频基础模型,针对自然风格化空间声学环境的高质量模拟以及真实环境录制,发布了这两个互补的基准任务套件:NatHEAR 和 RealSELD。我们的结果表明,GRAM在NatHEAR和干净单通道版本HEAR上超越了所有最先进的无监督音频基础模型,同时只使用了数据训练量的很大一部分。GRAM在模拟环境中显示出最先进的定位性能,并在RealSELD中的真实世界录制中高效泛化。综上所述,GRAM代表了向面向真实环境的稳健空间音频基础模型迈出的重要一步。
引用
@article{arxiv.2602.03307,
title = {GRAM: Spatial general-purpose audio representations for real-world environments},
author = {Goksenin Yuksel and Marcel van Gerven and Kiki van der Heijden},
journal= {arXiv preprint arXiv:2602.03307},
year = {2026}
}
备注
I have accidentally uploaded a revised version of my old paper. I meant to revise arXiv:2506.00934 rather than upload a new version