中文

NVC-Net:端到端对抗式语音转换

声音 2021-06-03 v1 人工智能 音频与语音处理

摘要

语音转换在许多语音合成应用中日益流行。其思想是在保持语言内容不变的同时,将说话人身份从一人转换为另一人。许多语音转换方法依赖于使用声码器从声学特征重建语音,因此语音质量严重依赖于此类声码器。本文中,我们提出 NVC-Net,一种端到端对抗网络,直接在任意长度的原始音频波形上执行语音转换。通过解耦说话人身份与语音内容,NVC-Net 能够执行非并行传统多对多语音转换以及基于未见目标说话人短语句的零样本语音转换。重要的是,NVC-Net 是非自回归且全卷积的,实现了快速推理。我们的模型在 NVIDIA V100 GPU 上能够以超过 3600 kHz 的速率生成样本,在相同硬件配置下比 SOTA 方法快数个数量级。在非并行多对多语音转换任务上的客观与主观评估表明,NVC-Net 以显著更少的参数取得了具有竞争力的结果。

关键词

引用

@article{arxiv.2106.00992,
  title  = {NVC-Net: End-to-End Adversarial Voice Conversion},
  author = {Bac Nguyen and Fabien Cardinaux},
  journal= {arXiv preprint arXiv:2106.00992},
  year   = {2021}
}