在富于表现力的端到端语音合成中有效利用变分嵌入容量
计算与语言
2019-10-29 v3 机器学习
声音
音频与语音处理
摘要
近期工作探索了用于富于表现力语音合成(支持韵律与风格的调控和迁移)的序列到序列潜变量模型,但尚未给出理解竞争方法间权衡的一致框架。本文中,我们提出以嵌入容量(嵌入关于数据所包含的信息量)作为分析语音潜变量模型行为的统一方法,将现有的启发式(非变分)方法与能够利用表征互信息的上界显式约束容量的变分方法进行比较。在我们提出的模型(Capacitron)中,我们表明通过对变分后验添加条件依赖使其匹配真实后验的形式,同一模型可用于高精度韵律迁移、与文本无关的样式迁移以及自然听感先验样本的生成。对于多说话人模型,Capacitron 能够在说话人间的韵律迁移以及从潜先验抽取样本时保留目标说话人身份。最后,我们引入一种将嵌入容量跨两组潜变量分层分解的方法,使得部分潜变量可被指定,其余变异性从学到的先验中采样。音频示例可在网上获取。
引用
@article{arxiv.1906.03402,
title = {Effective Use of Variational Embedding Capacity in Expressive End-to-End Speech Synthesis},
author = {Eric Battenberg and Soroosh Mariooryad and Daisy Stanton and RJ Skerry-Ryan and Matt Shannon and David Kao and Tom Bagby},
journal= {arXiv preprint arXiv:1906.03402},
year = {2019}
}
备注
Submitted to ICLR 2020