一种用于高性能神经语音合成的多阶段多码本 VQ-VAE 方法
声音
2022-09-23 v1 计算与语言
音频与语音处理
摘要
我们提出了一种用于高性能神经语音合成(TTS)的多阶段、多码本(MSMC)方法。基于向量量化变分自编码器(VQ-VAE)的特征分析器通过将语音训练数据的梅尔谱图在多阶段中逐步下采样为具有不同时间分辨率的 MSMC 表示(MSMCRs),并分别用多个 VQ 码本量化来编码。训练多阶段预测器,通过最小化重建均方误差(MSE)与“三元组损失”的组合损失,将输入文本序列逐步映射到 MSMCRs。在合成中,神经声码器将预测的 MSMCRs 转换为最终语音波形。所提方法使用一个女性说话人、时长 16 小时的英文 TTS 数据库进行训练与测试。所提 TTS 取得了 4.41 的 MOS 分数,优于 MOS 为 3.62 的基线。参数大幅减少的所提 TTS 紧凑版本仍能保持高 MOS 分数。消融研究表明,多阶段与多码本均对实现高 TTS 性能有效。
引用
@article{arxiv.2209.10887,
title = {A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS},
author = {Haohan Guo and Fenglong Xie and Frank K. Soong and Xixin Wu and Helen Meng},
journal= {arXiv preprint arXiv:2209.10887},
year = {2022}
}