MamTra:一种混合Mamba-Transformer 语音合成骨架
音频与语音处理
2026-03-16 v1
摘要
尽管LLM-based 文本语音系统在质量方面取得了显著进步,但它们依赖于自回归 Transformer,导致二次计算复杂度,严重限制了实际应用。线性时间替代方案,尤其是Mamba,提供了潜在的解决方案;然而,它们往往牺牲了对表达合成所必需的全局上下文。在本文中,我们提出MamTra,一种交错Mamba-Transformer 框架,旨在利用Mamba的效率与Transformer的建模能力。我们还引入了新颖的知识转移策略,从预训练的Transformer 那里蒸馏知识,以此规避从零开始训练的高昂成本。系统实验识别出最佳的混合配置,证明MamTra在推理VRAM使用方面可降低最高34%,而不损害语音保真度——即使仅使用原始训练数据集的2%进行训练。音频样本可在 https://mamtratts.github.io 获取。
关键词
引用
@article{arxiv.2603.12342,
title = {MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis},
author = {Tan Dat Nguyen and Sangmin Bae and Joon Son Chung and Ji-Hoon Kim},
journal= {arXiv preprint arXiv:2603.12342},
year = {2026}
}
备注
Submitted to Interspeech 2026