中文

NoiseVC:迈向高质量零样本语音转换

声音 2021-04-14 v1 机器学习 音频与语音处理

摘要

语音转换(VC)是一项将目标音频的语音转换为源语音而不丢失语言内容的任务,尤其在训练时源说话人与目标说话人均未见过(零样本VC)时具有挑战性。先前的方法需要预训练模型或语言数据来进行零样本转换。同时,采用矢量量化(VQ)或实例归一化(IN)的VC模型能够解耦音频中的内容并实现成功转换。然而,这些模型中的解耦高度依赖于强约束的瓶颈层,因此声音质量被大幅牺牲。本文中,我们提出NoiseVC,一种基于VQ与对比预测编码(CPC)实现内容解耦的方法。此外,执行噪声增强以进一步增强解耦能力。我们进行了若干实验并证明NoiseVC具有强解耦能力,且仅小幅牺牲质量。

关键词

引用

@article{arxiv.2104.06074,
  title  = {NoiseVC: Towards High Quality Zero-Shot Voice Conversion},
  author = {Shijun Wang and Damian Borth},
  journal= {arXiv preprint arXiv:2104.06074},
  year   = {2021}
}