Speech Slytherin:探讨 Mamba 在语音分离、识别和合成中的性能与效率
音频与语音处理
2024-07-16 v1 机器学习
声音
摘要
在多种语音相关任务中对比 Mamba 与变换器在性能和效率上的表现尚为早期,尚不能得出 Mamba 是变换器的更好替代方案。为此,我们提出并评估了三个模型用于三个任务:Mamba-TasNet 用于语音分离、ConMamba 用于语音识别、VALL-M 用于语音合成。我们在性能、内存和速度上将其与相似规模的变换器进行比较。我们的 Mamba 或 Mamba-变换器混合模型在性能上与其变换器对应项(Sepformer、Conformer 和 VALL-E)相当或更好;在语音长度超过特定阈值(与语音标记分辨率呈反比)时,内存和速度上更高效。Mamba 在分离任务中最有效,而在识别任务中最不有效。进一步我们表明,对于需要同时建模文本和语音的模型(如交叉注意力或掩码注意力两种输入),Mamba 在语音短于阈值长度时并不比变换器更高效,且在此类模型中表现更差。因此,我们认为 Mamba 或变换器的优劣取决于具体问题和模型。代码地址:https://github.com/xi-j/Mamba-TasNet 和 https://github.com/xi-j/Mamba-ASR。
引用
@article{arxiv.2407.09732,
title = {Speech Slytherin: Examining the Performance and Efficiency of Mamba for Speech Separation, Recognition, and Synthesis},
author = {Xilin Jiang and Yinghao Aaron Li and Adrian Nicolas Florea and Cong Han and Nima Mesgarani},
journal= {arXiv preprint arXiv:2407.09732},
year = {2024}
}