中文

Assem-VC:通过组装现代语音合成技术实现逼真语音转换

音频与语音处理 2021-10-12 v2 机器学习 声音

摘要

近期语音转换(VC)的工作侧重于保留源语音的节奏、语调以及语言内容。为从源中保留这些特征,我们将当前非并行 VC 系统分解为两个编码器与一个解码器。我们通过若干实验分析每个模块,并重新组装最佳组件以提出 Assem-VC,一种全新的最先进的任意到多非并行 VC 系统。我们还验证了 PPG 与 Cotatron 特征具有说话人依赖性,并尝试通过对抗训练去除说话人身份。代码与音频样本可在 https://github.com/mindslab-ai/assem-vc 获取。

关键词

引用

@article{arxiv.2104.00931,
  title  = {Assem-VC: Realistic Voice Conversion by Assembling Modern Speech Synthesis Techniques},
  author = {Kang-wook Kim and Seung-won Park and Junhyeok Lee and Myun-chul Joe},
  journal= {arXiv preprint arXiv:2104.00931},
  year   = {2021}
}