MambaVoiceCloning:通过状态空间建模与扩散控制实现高效且富有表现力的文本转语音
声音
2026-04-02 v1 机器学习
摘要
MambaVoiceCloning(MVC)探讨扩散式 TTS 的条件路径是否可以在推理时完全仅依赖 SSM(状态空间模型),移除文本、节奏和韵律上的所有注意力机制和显式 RNN 风格递归层,同时在受控条件下保持或提升质量。MVC 结合了门控双向 Mamba 文本编码器、由轻量对齐教师监督并在训练后丢弃的时间双向 Mamba(Temporal Bi-Mamba),以及采用 AdaLN 调制的表现力 Mamba(Expressive Mamba),实现了线性时间 O(T) 条件化,激活内存有界,并支持实用的有限前瞻流式推理。与推理时仍为混合架构的先前 Mamba-TTS 系统不同,MVC 在固定的 StyleTTS2 mel-diffusion-vocoder 骨干下去除了基于注意力的时长和风格模块。在 LJSpeech/LibriTTS 上训练,在 VCTK、CSS10(ES/DE/FR)和长篇 Gutenberg 文本上评估,MVC 在 MOS/CMOS、F0 RMSE、MCD 和 WER 上相比 StyleTTS2、VITS 和 Mamba-attention 混合模型取得了 modest 但统计上可靠的提升,同时将编码器参数减少至 21M,吞吐量提升 1.6 倍。扩散仍是主要的延迟来源,但纯 SSM 条件化改善了内存占用、稳定性和可部署性。
引用
@article{arxiv.2604.00292,
title = {MambaVoiceCloning: Efficient and Expressive Text-to-Speech via State-Space Modeling and Diffusion Control},
author = {Sahil Kumar and Namrataben Patel and Honggang Wang and Youshan Zhang},
journal= {arXiv preprint arXiv:2604.00292},
year = {2026}
}
备注
Accepted at ICLR 2026