基于帧与风格重构损失的富有表现力 TTS 训练
声音
2021-04-13 v2 音频与语音处理
摘要
我们提出一种用于基于 Tacotron 的文本到语音(TTS)系统的新颖训练策略,以提升语音的表现力。韵律建模的关键挑战之一是缺乏参考,使得显式建模困难。所提出的技术不需要来自训练数据的韵律标注,也不试图显式地对韵律建模,而是使用基于 Tacotron 的 TTS 框架编码输入文本与其韵律风格之间的关联。我们提出的思路背离了由一组韵律嵌入显式建模韵律的风格令牌范式。所提出的训练策略采用两个目标函数的组合:1)帧级重构损失,计算于合成谱特征与目标谱特征之间;2)话语级风格重构损失,计算于合成语音与目标语音的深度风格特征之间。所提出的风格重构损失被表述为一种感知损失,以确保训练过程中考虑话语级语音风格。实验表明,所提出的训练策略取得了卓越性能,并在自然度与表现力上优于最先进的基线。据我们所知,这是首项将话语级感知质量作为损失函数引入 Tacotron 训练以提升表现力的研究。
引用
@article{arxiv.2008.01490,
title = {Expressive TTS Training with Frame and Style Reconstruction Loss},
author = {Rui Liu and Berrak Sisman and Guanglai Gao and Haizhou Li},
journal= {arXiv preprint arXiv:2008.01490},
year = {2021}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing