面向高保真歌声转换:基于声学参考与对比预测编码
声音
2021-10-12 v1 计算与语言
音频与语音处理
摘要
近年来,基于音素后验图(PPG)的方法在非并行歌声转换系统中颇为流行。然而,由于 PPG 中缺乏声学信息,转换后歌声的风格与自然度仍受限。为解决这些问题,本文利用声学参考编码器隐式建模歌声特征。我们尝试不同辅助特征,包括梅尔频谱、HuBERT 以及预训练自动语音识别(ASR)模型的中间隐藏特征(PPG-Mid)作为参考编码器的输入,最终发现 HuBERT 特征是最佳选择。此外,我们使用对比预测编码(CPC)模块,通过在隐空间预测未来观测进一步平滑声音。实验表明,与基线模型相比,我们提出的模型能显著提升转换歌声的自然度及与目标歌手的相似度。而且,我们提出的模型还能让仅有语音数据的说话人唱歌。
引用
@article{arxiv.2110.04754,
title = {Towards High-fidelity Singing Voice Conversion with Acoustic Reference and Contrastive Predictive Coding},
author = {Chao Wang and Zhonghao Li and Benlai Tang and Xiang Yin and Yuan Wan and Yibiao Yu and Zejun Ma},
journal= {arXiv preprint arXiv:2110.04754},
year = {2021}
}