TTS-Transducer:基于神经换能器的端到端语音合成
音频与语音处理
2025-04-16 v1 人工智能
计算与语言
声音
摘要
本文介绍了TTS-Transducer——一种新颖的文本到语音架构,利用了音频编解码模型和神经换能器的优势。换能器以其在语音识别中的卓越质量和鲁棒性而闻名,用于学习单调对齐并避免使用显式时长预测器。神经音频编解码器将音频高效压缩为离散编码,揭示了将文本建模方法应用于语音生成的可能性。然而,由于音频编解码模型使用残差量化器,每帧需要从多个码本预测多个标记,这带来了重大挑战。所提出的系统首先使用换能器架构学习标记化文本与第一个码本的语音编解码标记之间的单调对齐。然后,非自回归Transformer使用从换能器损失中提取的对齐来预测剩余编码。所提出的系统是端到端训练的。我们表明TTS-Transducer是当代TTS系统的一个有竞争力和鲁棒的替代方案。
引用
@article{arxiv.2501.06320,
title = {TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer},
author = {Vladimir Bataev and Subhankar Ghosh and Vitaly Lavrukhin and Jason Li},
journal= {arXiv preprint arXiv:2501.06320},
year = {2025}
}
备注
Accepted by ICASSP 2025