中文

DualVC:使用模型内知识蒸馏和混合预测编码的双模式语音转换

音频与语音处理 2023-06-01 v2 声音

摘要

语音转换是一项日益流行的技术,越来越多的实时应用需要具有流式转换能力的模型。与典型的(非流式)语音转换(可以利用整个话语作为完整上下文)不同,流式语音转换由于缺少未来信息而面临重大挑战,导致可懂度、说话人相似度和音质下降。为了解决这一挑战,我们提出了DualVC,一种双模式神经语音转换方法,使用联合训练的单独网络参数支持流式和非流式模式。此外,我们提出了模型内知识蒸馏和混合预测编码(HPC)来增强流式转换的性能。此外,我们结合数据增强来训练一个鲁棒的自回归解码器,提高模型在长语音转换上的性能。实验结果表明,所提出的模型在流式语音转换方面优于基线模型,同时保持了与利用完整上下文的非流式顶级系统相当的性能,延迟仅为252.8毫秒。

关键词

引用

@article{arxiv.2305.12425,
  title  = {DualVC: Dual-mode Voice Conversion using Intra-model Knowledge Distillation and Hybrid Predictive Coding},
  author = {Ziqian Ning and Yuepeng Jiang and Pengcheng Zhu and Jixun Yao and Shuai Wang and Lei Xie and Mengxiao Bi},
  journal= {arXiv preprint arXiv:2305.12425},
  year   = {2023}
}