学习歌曲中的美:神经歌唱声音美化器
音频与语音处理
2022-03-03 v2 计算与语言
机器学习
多媒体
声音
摘要
我们关注一项新颖任务:歌唱声音美化(SVB)。给定业余歌手的歌唱声音,SVB 旨在改善声音的音准与音色,同时保留内容与发声音色。当前自动音高校正技术尚不成熟,且大多仅局限于音准而忽略整体审美质量。因此,我们引入神经歌唱声音美化器(NSVB)——首个解决 SVB 任务的生成模型,其采用条件变分自编码器作为主干并学习音色的潜在表示。在 NSVB 中,我们提出一种用于音高校正的新型时间扭曲方法:形状感知动态时间扭曲(SADTW),它改善了现有时间扭曲方法的鲁棒性,以使业余录音与模板音高曲线同步。此外,我们在潜在空间中提出一种潜在映射算法,将业余音色转换为专业音色。为此,我们还提出了一个包含业余与专业版本平行歌唱录音的新数据集。在中英文歌曲上的大量实验从客观与主观指标两方面证明了我们方法的有效性。音频样本见~\url{https://neuralsvb.github.io}。代码:\url{https://github.com/MoonInTheRiver/NeuralSVB}。
引用
@article{arxiv.2202.13277,
title = {Learning the Beauty in Songs: Neural Singing Voice Beautifier},
author = {Jinglin Liu and Chengxi Li and Yi Ren and Zhiying Zhu and Zhou Zhao},
journal= {arXiv preprint arXiv:2202.13277},
year = {2022}
}
备注
Accepted by ACL 2022 Main conference; Code: https://github.com/MoonInTheRiver/NeuralSVB