基于非平行数据的歌声转换
音频与语音处理
2019-03-12 v1 机器学习
声音
机器学习
摘要
歌声转换是一项将源歌手演唱的歌曲转换为目标歌手声音的任务。在本文中,我们提出在歌声上采用一种无需平行数据、多对一的语音转换技术。首先通过鲁棒的自动语音识别引擎(ASR)对歌声进行解码,生成音素后验特征。然后,使用训练好的具有深度双向长短期记忆(DBLSTM)结构的循环神经网络(RNN)来建模从与说话人无关的内容到目标人声学特征的映射。F0和非周期成分通过原始歌声获得,并与声学特征一起通过声码器重建目标歌声。在得到的歌声中,目标歌手与源歌手听起来相似。据我们所知,这是首项使用非平行数据训练歌声转换系统的研究。主观评价表明,所提方法能有效转换歌声。
引用
@article{arxiv.1903.04124,
title = {Singing voice conversion with non-parallel data},
author = {Xin Chen and Wei Chu and Jinxi Guo and Ning Xu},
journal= {arXiv preprint arXiv:1903.04124},
year = {2019}
}
备注
Accepted to MIPR 2019