中文

用于高质量语音合成的超轻量级神经微分 DSP 声码器

声音 2024-01-22 v1 机器学习 音频与语音处理

摘要

神经声码器对原始音频波形进行建模并合成高质量音频,但即使是 MB-MelGAN 和 LPCNet 等高效声码器,也无法在智能眼镜等低端设备上实时运行。基于纯数字信号处理 (DSP) 的声码器可以通过轻量级快速傅里叶变换 (FFT) 实现,因此比任何神经声码器都要快一个数量级。由于消耗了声道近似表示的过平滑声学模型预测,DSP 声码器通常获得的音频质量较低。本文提出了一种超轻量级微分 DSP (DDSP) 声码器,该声码器使用与 DSP 声码器联合优化的声学模型,并且在没有提取声道频谱特征的情况下进行学习。该模型实现了可与神经声码器相媲美的音频质量,平均 MOS 高达 4.36,同时具备 DSP 声码器的高效性。我们的 C++ 实现无需任何特定于硬件的优化,计算量为 15 MFLOPS,在 FLOPS 方面比 MB-MelGAN 快 340 倍,在 2GHz Intel Xeon CPU 上单线程运行时,实现了仅声码器 RTF 为 0.003、整体 RTF 为 0.044 的性能。

关键词

引用

@article{arxiv.2401.10460,
  title  = {Ultra-lightweight Neural Differential DSP Vocoder For High Quality Speech Synthesis},
  author = {Prabhav Agrawal and Thilo Koehler and Zhiping Xiu and Prashant Serai and Qing He},
  journal= {arXiv preprint arXiv:2401.10460},
  year   = {2024}
}

备注

Accepted for ICASSP 2024