SepMamba:使用 Mamba 进行说话人分离的状态空间模型
声音
2024-10-29 v1 机器学习
音频与语音处理
摘要
近年来,基于深度学习的单通道说话人分离技术取得了显著进步,这主要归功于基于 Transformer 的注意力机制的引入。然而,这些改进是以巨大的计算需求为代价的,阻碍了它们在许多实际应用中的使用。最近提出的 Mamba 作为一种具有类似建模能力但计算效率更高的替代方案。我们提出了 SepMamba,一种主要由双向 Mamba 层组成的基于 U-Net 的架构。我们发现,我们的方法在 WSJ0 2 说话人数据集上优于同等规模的知名模型——包括基于 Transformer 的模型——同时在计算成本、内存使用和前向传播时间方面显著降低。我们还报告了 SepMamba 因果变体的强劲结果。我们的方法为深度语音分离提供了一种在计算上优于基于 Transformer 架构的替代方案。
引用
@article{arxiv.2410.20997,
title = {SepMamba: State-space models for speaker separation using Mamba},
author = {Thor Højhus Avenstrup and Boldizsár Elek and István László Mádi and András Bence Schin and Morten Mørup and Bjørn Sand Jensen and Kenny Falkær Olsen},
journal= {arXiv preprint arXiv:2410.20997},
year = {2024}
}