中文

wav2pos:基于掩码自编码器的声源定位

音频与语音处理 2024-12-17 v1 机器学习 声音

摘要

我们提出了一种用于分布式非结构化麦克风阵列的三维声源定位任务的新方法,通过将其表述为集合到集合的回归问题。我们训练了一个在音频录音和麦克风坐标上运行的多模态掩码自编码器模型,证明了这种表述允许对声源进行精确定位,通过重建输入中被掩码的坐标。我们的方法具有灵活性,即使在一部分音频录音和麦克风坐标缺失的情况下,也可以使用单个模型。我们在室内环境中针对音乐和语音的仿真和真实录音进行测试,并证明了与经典方法和其他基于学习的方法相比性能具有竞争力。

关键词

引用

@article{arxiv.2408.15771,
  title  = {wav2pos: Sound Source Localization using Masked Autoencoders},
  author = {Axel Berg and Jens Gulin and Mark O'Connor and Chuteng Zhou and Karl Åström and Magnus Oskarsson},
  journal= {arXiv preprint arXiv:2408.15771},
  year   = {2024}
}

备注

IPIN 2024