中文

基于 Mamba 的全向注意力机制用于语音分离

声音 2026-01-26 v1 音频与语音处理

摘要

Mamba 是一种选择性状态空间模型 (SSM),已成为 Transformer 语音建模的高效替代方案,能够以线性复杂度处理长序列。虽然在语音分离中效果良好,但现有方法无论是时域还是时频域,通常都会将输入在单个维度上分解为短的单维序列,再用 Mamba 处理,这限制了其仅进行局部一维建模,限制了其捕获跨 2D 声谱图全局依赖的能力。本文提出一种基于单向 Mamba 的高效全向注意力 (OA) 机制,模型化声谱图上来自十个不同方向的全局依赖。我们将该机制扩展为两种基线分离模型,并在三个公开数据集上进行评估。实验结果表明,我们的方法在保持线性复杂度的同时始终显著优于基线,超过现有最先进 (SOTA) 系统。

关键词

引用

@article{arxiv.2601.16603,
  title  = {Omni-directional attention mechanism based on Mamba for speech separation},
  author = {Ke Xue and Chang Sun and Rongfei Fan and Jing Wang and Han Hu},
  journal= {arXiv preprint arXiv:2601.16603},
  year   = {2026}
}