UniTTS:用于语音风格控制的统一嵌入空间残差学习
音频与语音处理
2022-03-02 v3 人工智能
机器学习
声音
信号处理
摘要
我们提出一种新颖的高保真表现力语音合成模型UniTTS,其学习并控制重叠风格属性以避免干扰。UniTTS通过施加属性前后音素嵌入之间的残差,在单一统一嵌入空间中表示多个风格属性。所提方法尤其在控制难以干净分离的多个属性(如说话人ID与情感)时有效,因为它在增加说话人ID与情感方差时最小化冗余,并基于说话人ID与情感预测时长、音高与能量。实验中,可视化结果显示所提方法以可再次轻松分离的方式协调学习了多个属性。同时,UniTTS合成了控制多个风格属性的高保真语音信号。合成语音样本见 https://anonymous-authors2022.github.io/paper_works/UniTTS/demos/。
引用
@article{arxiv.2106.11171,
title = {UniTTS: Residual Learning of Unified Embedding Space for Speech Style Control},
author = {Minsu Kang and Sungjae Kim and Injung Kim},
journal= {arXiv preprint arXiv:2106.11171},
year = {2022}
}
备注
20 pages, 11 figures