中文

通过学习紧凑语音表示实现低资源语言的高质量神经TTS

声音 2022-10-28 v1 计算与语言 音频与语音处理

摘要

本文旨在通过使用紧凑的语音表示来减少训练数据需求,从而增强低资源TTS。训练了一个多阶段多码本(MSMC)VQ-GAN来学习表示MSMCR,并将其解码为波形。随后,我们训练多阶段预测器从文本预测MSMCR以进行TTS合成。此外,我们通过利用更多音频来更好地为低资源语言学习MSMCR,从而优化训练策略。它使用说话人相似度度量从其他语言中选择音频来扩充训练集,并应用迁移学习来提高训练质量。在MOS测试中,所提出的系统在标准和低资源场景下均显著优于FastSpeech和VITS,显示出更低的数据需求。所提出的训练策略有效地增强了MSMCR在波形重建上的表现。它进一步提高了TTS性能,在仅使用15分钟配对数据的低资源TTS偏好测试中赢得了77%的投票。

关键词

引用

@article{arxiv.2210.15131,
  title  = {Towards High-Quality Neural TTS for Low-Resource Languages by Learning Compact Speech Representations},
  author = {Haohan Guo and Fenglong Xie and Xixin Wu and Hui Lu and Helen Meng},
  journal= {arXiv preprint arXiv:2210.15131},
  year   = {2022}
}

备注

Submitted to ICASSP 2023