基于 Tacotron 的表现力语音合成端到端韵律迁移
计算与语言
2018-03-28 v1 机器学习
声音
音频与语音处理
摘要
我们提出了对 Tacotron 语音合成架构的扩展,该扩展学习从包含所需韵律的参考声学表示中导出的韵律潜在嵌入空间。我们表明,以此学习到的嵌入空间作为 Tacotron 的条件,即使参考和合成说话人不同,所合成的音频也能在精细时间细节上匹配参考信号的韵律。此外,我们表明参考韵律嵌入可用于合成与参考话语不同的文本。我们定义了几个用于评估韵律迁移的定量和主观指标,并报告了单说话人和 44 说话人 Tacotron 模型在韵律迁移任务上的结果及附带的音频样本。
引用
@article{arxiv.1803.09047,
title = {Towards End-to-End Prosody Transfer for Expressive Speech Synthesis with Tacotron},
author = {RJ Skerry-Ryan and Eric Battenberg and Ying Xiao and Yuxuan Wang and Daisy Stanton and Joel Shor and Ron J. Weiss and Rob Clark and Rif A. Saurous},
journal= {arXiv preprint arXiv:1803.09047},
year = {2018}
}