中文

基于循环变分自编码器与数据驱动线性预测多带WaveRNN的低延迟实时非并行语音转换

声音 2021-07-06 v2 计算与语言 机器学习 音频与语音处理

摘要

本文提出一种基于循环变分自编码器(CycleVAE)与数据驱动线性预测多带WaveRNN(MWDLP)的低延迟实时(LLRT)非并行语音转换(VC)框架。CycleVAE是一种鲁棒的非并行多说话人频谱模型,其利用说话人无关的潜在空间与说话人相关的编码,在给定输入说话人频谱特征的情况下生成重构/转换后的频谱特征。另一方面,MWDLP是一种高效且高质量的神经声码器,可处理多说话人数据并利用CPU生成用于LLRT应用的语音波形。为适应CPU上的LLRT约束,我们提出一种新颖的CycleVAE框架,其利用梅尔频谱作为频谱特征,并采用稀疏网络架构构建。此外,为提升建模性能,我们还提出一种新颖的微调流程,利用来自MWDLP网络的波形损失对帧率CycleVAE网络进行精炼。实验结果表明,所提框架实现了高性能VC,同时可在单核2.12.1--2.72.7 GHz CPU上以0.870.87--0.950.95的实时因子实现LLRT使用,包括输入/输出、特征提取,帧移为1010 ms、窗长为27.527.5 ms以及22个查找帧。

关键词

引用

@article{arxiv.2105.09858,
  title  = {Low-Latency Real-Time Non-Parallel Voice Conversion based on Cyclic Variational Autoencoder and Multiband WaveRNN with Data-Driven Linear Prediction},
  author = {Patrick Lumban Tobing and Tomoki Toda},
  journal= {arXiv preprint arXiv:2105.09858},
  year   = {2021}
}

备注

Accepted for SSW11