基于风格标签的表现力文本到语音合成
音频与语音处理
2022-10-07 v2
摘要
随着近期文本到语音合成(TTS)系统在语音质量和生成速度上的快速提升,许多研究者开始关注一个更具挑战性的问题:表现力 TTS。为控制说话风格,现有表现力 TTS 模型使用类别风格索引或参考语音作为风格输入。本文提出 StyleTagging-TTS(ST-TTS),一种利用自然语言书写的风格标签的新型表现力 TTS 模型。通过使用风格标注的 TTS 数据集和预训练语言模型,我们对语言嵌入与说话风格域之间的关系进行建模,使模型即使在训练时未见的风格标签下也能工作。由于风格标签以自然语言书写,与风格索引或参考语音相比,它能以更直观、可解释且可扩展的方式控制说话风格。此外,在模型架构方面,我们提出了一种具有单阶段训练的高效非自回归(NAR)TTS 架构。实验结果表明,ST-TTS 在语音质量和表现力上优于现有的表现力 TTS 模型 Tacotron2-GST。
引用
@article{arxiv.2104.00436,
title = {Expressive Text-to-Speech using Style Tag},
author = {Minchan Kim and Sung Jun Cheon and Byoung Jin Choi and Jong Jin Kim and Nam Soo Kim},
journal= {arXiv preprint arXiv:2104.00436},
year = {2022}
}
备注
Accepted by Interspeech 2021