中文

QS-TTS:基于向量量化自监督语音表征学习的半监督文本到语音合成

声音 2023-09-04 v1 计算与语言 音频与语音处理

摘要

本文提出一种新颖的半监督TTS框架QS-TTS,通过利用更多无标签语音音频的向量量化自监督语音表征学习(VQ-S3RL)以更低监督数据需求提升TTS质量。该框架包含两个VQ-S3R学习器:首先,主学习器旨在通过结合对比式S3RL的MSMC-VQ-GAN提供生成式多阶段多码本(MSMC)VQ-S3R,并将其解码回高质量音频;随后,辅助学习器通过VQ-VAE将MSMC表征进一步抽象为高度紧凑的VQ表征。这两个生成式VQ-S3R学习器为TTS提供了有益的语音表征与预训练模型,显著以更低的监督数据需求提升了合成质量。QS-TTS在实验中通过主观与客观测试在各种场景下得到全面评估。结果有力证明了QS-TTS的优越性能,在监督或半监督基线TTS方法中赢得最高MOS,尤其在低资源场景下。此外,比较TTS中各种语音表征与迁移学习方法进一步验证了所提VQ-S3RL对TTS的显著提升,展现出最佳音频质量与可懂度指标。QS-TTS合成质量随监督数据减少而更缓衰减的趋势进一步凸显了其更低的监督数据需求,表明其在低资源场景中的巨大潜力。

关键词

引用

@article{arxiv.2309.00126,
  title  = {QS-TTS: Towards Semi-Supervised Text-to-Speech Synthesis via Vector-Quantized Self-Supervised Speech Representation Learning},
  author = {Haohan Guo and Fenglong Xie and Jiawen Kang and Yujia Xiao and Xixin Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2309.00126},
  year   = {2023}
}