中文

StyleSpeech:基于 VQ-VAE 预训练的自监督风格增强用于 expressive 有声书语音合成

声音 2023-12-20 v1 人工智能 音频与语音处理

摘要

有声书合成语音的 expressive 质量受到通用模型架构和训练数据中风格分布不平衡的限制。为解决这些问题,本文提出了一种基于 VQ-VAE 预训练的自监督风格增强方法,用于 expressive 有声书语音合成。首先,利用大量无标签纯文本数据预训练文本风格编码器。其次,基于 VQ-VAE 的语谱图风格提取器以自监督方式进行预训练,使用了涵盖复杂风格变化的大量音频数据。然后,专门设计了一种具有双编码器 - 解码器路径的新颖架构,分别在风格提取器的指导下对发音和高层风格 expressive 进行建模。客观和主观评估均表明,我们提出的方法能有效提高有声书合成中合成语音的自然度和 expressive,尤其在角色配音和跨域场景中表现突出。

关键词

引用

@article{arxiv.2312.12181,
  title  = {StyleSpeech: Self-supervised Style Enhancing with VQ-VAE-based Pre-training for Expressive Audiobook Speech Synthesis},
  author = {Xueyuan Chen and Xi Wang and Shaofei Zhang and Lei He and Zhiyong Wu and Xixin Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2312.12181},
  year   = {2023}
}

备注

Accepted to ICASSP 2024