中文

音乐源分离模型是否保留双声道音频中的空间信息?

音频与语音处理 2025-07-02 v1 声音 信号处理

摘要

双声道音频在音乐信息检索领域仍属未充分探索的领域。ederated by the rising popularity of virtual and augmented reality experiences as well as potential applications to accessibility, we investigate how well existing music source separation (MSS) models perform on binaural audio. 虽然这些模型处理两个声道的输入,但清楚地看到它们在保持空间信息方面有多么有效。 In this work, we evaluate how several popular MSS models preserve spatial information on both standard stereo and novel binaural datasets. 我们的双声道数据是使用来自MUSDB18-HQ的stem以及开源的头相关传递函数,通过在水平平面上随机定位乐器来源来合成的。然后,我们使用信号处理和interaural cue-based指标评估分离stem的空间质量。我们的结果显示,标准MSS模型未能保留维持双声道音频沉浸式质量的关键空间信息,并且该降解程度取决于模型体系结构以及目标乐器。最后,我们在MSS和沉浸式音频的交叉领域指出了宝贵的未来工作机会。

关键词

引用

@article{arxiv.2507.00155,
  title  = {Do Music Source Separation Models Preserve Spatial Information in Binaural Audio?},
  author = {Richa Namballa and Agnieszka Roginska and Magdalena Fuentes},
  journal= {arXiv preprint arXiv:2507.00155},
  year   = {2025}
}

备注

6 pages + references, 4 figures, 2 tables, 26th International Society for Music Information Retrieval (ISMIR) Conference