中文

MSStyleTTS:基于层次上下文信息多尺度风格建模的表达性语音合成

声音 2023-08-01 v1 音频与语音处理

摘要

表达性语音合成对于有声书、播客和语音助手等许多人机交互场景至关重要。以往工作侧重于从当前句子内的信息中预测单一尺度的风格嵌入。然而,相邻句子中的上下文信息以及人类语音中风格的多尺度特性被忽视,使得将多句文本转换为自然且富有表现力的语音颇具挑战。本文提出 MSStyleTTS,一种用于表达性语音合成的风格建模方法,以从比句子更广的上下文范围中捕获并预测不同层次的风格。两个子模块(包括多尺度风格提取器和多尺度风格预测器)与基于 FastSpeech 2 的声学模型共同训练。该预测器旨在通过考虑上下文中的结构关系来探索层次上下文信息,并预测全局级、句子级和子词级的风格嵌入。提取器从真值语音中提取多尺度风格嵌入,并显式地引导风格预测。在域内和域外有声书数据集上的评估表明,所提方法显著优于三个基线。此外,我们对以往从未讨论过的上下文信息和多尺度风格表示进行了分析。

关键词

引用

@article{arxiv.2307.16012,
  title  = {MSStyleTTS: Multi-Scale Style Modeling with Hierarchical Context Information for Expressive Speech Synthesis},
  author = {Shun Lei and Yixuan Zhou and Liyang Chen and Zhiyong Wu and Xixin Wu and Shiyin Kang and Helen Meng},
  journal= {arXiv preprint arXiv:2307.16012},
  year   = {2023}
}

备注

Accepted by IEEE/ACM Transactions on Audio, Speech, and Language Processing