中文

GRAM:面向真实世界应用的空间通用音频表示模型

声音 2026-02-05 v5 人工智能 音频与语音处理

摘要

音频基础模型学习通用音频表示,以促进广泛的下游任务。尽管这些模型在传统单通道、干音频片段上的性能已大幅提升,但它们在存在混响和噪声的真实声学环境中的成功仍然有限。此外,大多数音频基础模型忽略了真实声学环境的空间维度,排除了涉及声源定位的任务。为了解决这些局限性,我们提出了GRAM:一种通用真实世界音频模型,它采用多通道掩码自编码器来高效学习空间音频表示。我们在自然空间声学环境的高质量模拟以及真实世界环境录音中,以标准化方式评估了GRAM及其他音频基础模型,并发布了这两个互补的基准测试任务套件:NatHEAR和RealSELD。我们的结果表明,GRAM在NatHEAR及其干净的单通道版本HEAR上的表现优于所有最先进的自监督音频基础模型,且仅使用了一小部分训练数据。GRAM还在模拟环境中展现出最先进的定位性能,并在RealSELD中高效泛化至真实世界录音。总而言之,GRAM向适用于真实世界环境的稳健空间音频基础模型迈出了重要一步。

关键词

引用

@article{arxiv.2506.00934,
  title  = {GRAM: Spatial general-purpose audio representation models for real-world applications},
  author = {Goksenin Yuksel and Marcel van Gerven and Kiki van der Heijden},
  journal= {arXiv preprint arXiv:2506.00934},
  year   = {2026}
}

备注

Revise with RealSELD