PitchNet:基于音高对抗网络的无监督歌声转换
声音
2020-02-19 v2 计算与语言
音频与语音处理
摘要
歌声转换旨在不改变演唱内容的前提下将一位歌手的声音转换为另一位歌手的声音。近期工作表明,基于自编码器的方案 [1] 可实现无监督歌声转换。然而,转换后的歌声容易跑调,表明现有方法无法精确建模音高信息。本文提出对 [1] 中提出的现有无监督歌声转换方法进行改进,以实现更精确的音高平移与灵活的音高操控。具体而言,所提出的 PitchNet 增加了一个对抗训练的音高回归网络,以迫使编码器网络学习音高不变的音素表示,并引入独立模块将源音频提取的音高送入解码器网络。我们的评估表明,所提方法能大幅提升转换歌声的质量(MOS 从 2.92 提升至 3.75)。我们还展示了在生成过程中,通过在将提取音高送入解码器网络前改变其电平,可轻松控制转换歌声的音高。
引用
@article{arxiv.1912.01852,
title = {PitchNet: Unsupervised Singing Voice Conversion with Pitch Adversarial Network},
author = {Chengqi Deng and Chengzhu Yu and Heng Lu and Chao Weng and Dong Yu},
journal= {arXiv preprint arXiv:1912.01852},
year = {2020}
}
备注
Accepted by ICASSP 2020