富有表现力的神经语音克隆
声音
2021-02-02 v1 机器学习
音频与语音处理
摘要
语音克隆是从少量样本中学习合成未见说话人声音的任务。尽管当前语音克隆方法在为新生声音进行文本到语音(TTS)合成方面取得了可喜结果,但这些方法缺乏控制合成音频表现力的能力。本工作中,我们提出一种可控语音克隆方法,允许对未见说话人合成语音的各方面风格进行细粒度控制。为此,我们在训练时显式地将语音合成模型以说话人编码、音高轮廓和潜风格令牌为条件。通过定量与定性评估,我们表明我们的框架可仅利用新生说话人的少量转写或非转写语音样本,用于各类富有表现力的语音克隆任务。这些克隆任务包括来自参考语音的风格迁移、直接从文本合成语音,以及在推理时通过操纵风格条件变量实现细粒度风格控制。
引用
@article{arxiv.2102.00151,
title = {Expressive Neural Voice Cloning},
author = {Paarth Neekhara and Shehzeen Hussain and Shlomo Dubnov and Farinaz Koushanfar and Julian McAuley},
journal= {arXiv preprint arXiv:2102.00151},
year = {2021}
}
备注
12 pages, 2 figures, 2 tables