MaskGCT:基于掩码生成式编解码器Transformer的零样本文本到语音合成
声音
2024-10-22 v3 人工智能
机器学习
音频与语音处理
摘要
近期的大规模文本到语音(TTS)系统通常分为自回归和非自回归系统。自回归系统隐式地建模时长,但在鲁棒性和时长可控性方面表现出某些不足。非自回归系统在训练期间需要文本和语音之间的显式对齐信息,并预测语言单元(如音素)的时长,这可能损害其自然度。在本文中,我们介绍了掩码生成式编解码器Transformer(MaskGCT),这是一个完全非自回归的TTS模型,它消除了对文本与语音监督之间显式对齐信息以及音素级时长预测的需求。MaskGCT是一个两阶段模型:在第一阶段,模型使用文本预测从语音自监督学习(SSL)模型中提取的语义令牌;在第二阶段,模型以这些语义令牌为条件预测声学令牌。MaskGCT遵循掩码-预测学习范式。在训练期间,MaskGCT学习基于给定的条件和提示来预测被掩码的语义或声学令牌。在推理期间,模型以并行方式生成指定长度的令牌。使用10万小时真实场景语音进行的实验表明,MaskGCT在质量、相似度和可懂度方面均优于当前最先进的零样本TTS系统。音频样本可在 https://maskgct.github.io/ 获取。我们在 https://github.com/open-mmlab/Amphion/blob/main/models/tts/maskgct 发布了代码和模型检查点。
引用
@article{arxiv.2409.00750,
title = {MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer},
author = {Yuancheng Wang and Haoyue Zhan and Liwei Liu and Ruihong Zeng and Haotian Guo and Jiachen Zheng and Qiang Zhang and Xueyao Zhang and Shunsi Zhang and Zhizheng Wu},
journal= {arXiv preprint arXiv:2409.00750},
year = {2024}
}