Basis-MelGAN:基于音频分解的高效神经声码器
声音
2021-06-28 v1 音频与语音处理
摘要
近期研究表明,基于生成对抗网络(GAN)的神经声码器可生成高质量音频。尽管基于 GAN 的神经声码器已被证明比基于自回归预测的声码器计算效率高得多,但在 CPU 上实时生成最高质量音频仍是一项极具挑战的任务。所有基于 GAN 的神经声码器的主要计算之一来自堆叠上采样层,其设计用于匹配波形输出长度与 temporal resolution。同时,上采样网络的计算复杂度与每窗口生成的样本数密切相关。为降低上采样层计算,我们提出一种名为 Basis-MelGAN 的基于 GAN 的新神经声码器,其中原始音频样本被分解为学习到的基及其关联权重。由于 Basis-MelGAN 的预测目标是与每个所学基关联的权重值而非原始音频样本,其上采样层可用简单得多的网络设计。与其他基于 GAN 的神经声码器相比,所提 Basis-MelGAN 能生成可比的高质量音频,但计算复杂度从 HiFi-GAN V1 的 17.74 GFLOPs 显著降至 7.95 GFLOPs。
引用
@article{arxiv.2106.13419,
title = {Basis-MelGAN: Efficient Neural Vocoder Based on Audio Decomposition},
author = {Zhengxi Liu and Yanmin Qian},
journal= {arXiv preprint arXiv:2106.13419},
year = {2021}
}
备注
Accepted to INTERSPEECH 2021