中文

基于多步变分自编码器的富有表现力的段落文本转语音合成

声音 2024-09-26 v4 音频与语音处理

摘要

神经网络已能生成高质量的单句语音。然而,由于语义与声学特征的段落内相关性以及多变的风格,有声书语音合成仍具挑战。本文中,我们提出一种具有高表现力的段落语音合成系统,采用多步变分自编码器,称为 EP-MSTTS。EP-MSTTS 是首个基于 VITS 的段落语音合成模型,并在五个层级建模段落语音的多变风格:帧、音素、词、句子与段落。我们还提出一系列改进以增强该分层模型的性能。此外,我们直接在按段落而非句子切分的语音上训练 EP-MSTTS。在 Blizzard Challenge 2023 发布的单说话人法语有声书语料上的实验结果表明,EP-MSTTS 取得优于基线模型的性能。

关键词

引用

@article{arxiv.2308.13365,
  title  = {Expressive paragraph text-to-speech synthesis with multi-step variational autoencoder},
  author = {Xuyuan Li and Zengqiang Shang and Peiyang Shi and Hua Hua and Ta Li and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2308.13365},
  year   = {2024}
}

备注

accepted at Interspeech 2024