基于离散标记器和分组遮盖语言模型的高保真文本转语音
音频与语音处理
2024-06-26 v1
摘要
我们提出了一种新颖的两阶段文本转语音(TTS)框架,使用两种类型的离散标记,即语义标记和声学标记,以实现高保真语音合成。该框架具有两个核心组件:解释模块处理文本和语音提示输入,生成聚焦于语言内容和对齐的语义标记;发声模块捕捉目标语音的音色,从语义标记生成声学标记,丰富语音重建。解释阶段采用转换器以其在文本与语音对齐方面的鲁棒性;相反,发声阶段利用基于Conformer的架构集成分组遮盖语言模型(G-MLM),以提升计算效率。我们的实验验证了这一创新结构在零样本场景下在语音质量和说话人相似性方面优于传统模型。
引用
@article{arxiv.2406.17310,
title = {High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model},
author = {Joun Yeop Lee and Myeonghun Jeong and Minchan Kim and Ji-Hyun Lee and Hoon-Young Cho and Nam Soo Kim},
journal= {arXiv preprint arXiv:2406.17310},
year = {2024}
}
备注
Accepted by Interspeech2024