中文

文本感知与上下文感知的表达式 Audiobook 语音合成

音频与语音处理 2024-06-13 v3

摘要

近期的文本转语音技术显著提升了合成语音的表达性。然而,最大的挑战之一仍是生成能够捕捉专业叙书者在有声书中所展现的多样化语音风格的语音,而无需依赖手动标记的数据或参考语音。为此,我们提出了一种面向有声书语音合成的文本感知与上下文感知(TACA)风格建模方法。我们首先通过对话学习,以语音风格为监督,建立文本感知风格空间以覆盖多样化风格。同时,我们采用上下文编码器来融合跨句信息和从文本获取的风格嵌入。最后,我们将该方法引入两种典型的 TTS 模型,即基于 VITS 的 TTS 和基于语言模型的 TTS。实验结果表明,我们提出的方法能够有效捕捉多样化风格和连贯的韵律,从而在有声书语音合成中提高了自然性和表达性。

关键词

引用

@article{arxiv.2406.05672,
  title  = {Text-aware and Context-aware Expressive Audiobook Speech Synthesis},
  author = {Dake Guo and Xinfa Zhu and Liumeng Xue and Yongmao Zhang and Wenjie Tian and Lei Xie},
  journal= {arXiv preprint arXiv:2406.05672},
  year   = {2024}
}

备注

Accepted by INTERSPEECH2024