NoiseVC:迈向高质量零样本语音转换
声音
2021-04-14 v1 机器学习
音频与语音处理
摘要
语音转换(VC)是一项将目标音频的语音转换为源语音而不丢失语言内容的任务,尤其在训练时源说话人与目标说话人均未见过(零样本VC)时具有挑战性。先前的方法需要预训练模型或语言数据来进行零样本转换。同时,采用矢量量化(VQ)或实例归一化(IN)的VC模型能够解耦音频中的内容并实现成功转换。然而,这些模型中的解耦高度依赖于强约束的瓶颈层,因此声音质量被大幅牺牲。本文中,我们提出NoiseVC,一种基于VQ与对比预测编码(CPC)实现内容解耦的方法。此外,执行噪声增强以进一步增强解耦能力。我们进行了若干实验并证明NoiseVC具有强解耦能力,且仅小幅牺牲质量。
引用
@article{arxiv.2104.06074,
title = {NoiseVC: Towards High Quality Zero-Shot Voice Conversion},
author = {Shijun Wang and Damian Borth},
journal= {arXiv preprint arXiv:2104.06074},
year = {2021}
}