中文

Mamba2 遇见静默:面向稀疏区域的鲁棒人声源分离

声音 2026-01-01 v2 人工智能 音频与语音处理

摘要

我们引入一种专为精确人声隔离而定制的新音乐源分离模型。与通常无法捕捉间歇性出现人声的 Transformer 方法不同,我们的模型利用 Mamba2(一种最新的状态空间模型)来更好地捕捉长程时间依赖关系。为高效处理长输入序列,我们将频带分割策略与双路径架构相结合。实验表明,我们的方法优于近期最先进的模型,达到了 11.03 dB 的 cSDR——迄今为止报告的最佳结果——并在 uSDR 上取得了显著提升。此外,该模型在不同输入长度和人声出现模式下均表现出稳定且一致的性能。这些结果证明了基于 Mamba 的模型在高分辨率音频处理中的有效性,并为音频研究中更广泛的应用开辟了新方向。

关键词

引用

@article{arxiv.2508.14556,
  title  = {Mamba2 Meets Silence: Robust Vocal Source Separation for Sparse Regions},
  author = {Euiyeon Kim and Yong-Hoon Choi},
  journal= {arXiv preprint arXiv:2508.14556},
  year   = {2026}
}