DurIAN-SC:基于时长感知注意力网络的歌声转换系统
音频与语音处理
2020-08-10 v1 声音
摘要
歌声转换是将源歌声中的音色转换为目标说话人的声音,同时保持演唱内容不变。然而,与目标说话人相关的歌唱数据相比普通语音数据更难收集。本文提出一种歌声转换算法,仅利用目标说话人的普通语音数据即可生成高质量的目标说话人歌唱声音。首先,我们通过统一标准语音合成系统与歌唱合成系统中所使用的特征,将语音与歌唱的训练及转换过程整合到同一框架中。这样,普通语音数据也能用于歌声转换训练,使歌声转换系统更加鲁棒,尤其在歌唱数据库较小时。此外,为实现一次性歌声转换,我们利用语音与歌唱数据开发了一个说话人嵌入模块,在转换过程中提供目标说话人身份信息。实验表明,所提出的歌声转换系统仅使用20秒目标说话人的注册语音数据,即可将源歌声转换为目标说话人的高质量歌唱。
引用
@article{arxiv.2008.03009,
title = {DurIAN-SC: Duration Informed Attention Network based Singing Voice Conversion System},
author = {Liqiang Zhang and Chengzhu Yu and Heng Lu and Chao Weng and Chunlei Zhang and Yusong Wu and Xiang Xie and Zijin Li and Dong Yu},
journal= {arXiv preprint arXiv:2008.03009},
year = {2020}
}
备注
Accepted by Interspeech 2020