中文

WaveNeXt 2:基于ConvNeXt的快速神经声码器,带残差去噪与子建模,适用于GAN与扩散模型

音频与语音处理 2026-05-26 v1

摘要

大多数神经声码器局限于单一类型:要么是GAN要么是扩散模型。虽然像Vocos和WaveNeXt这样的前沿模型使用强大的ConvNeXt生成器,但仅用于GAN框架,在多说话人设置下性能有限。此外,虽然扩散模型在训练上快于GAN,但CPU推理却很慢。本文引入WaveNeXt 2,一个统一的ConvNeXt框架,兼容GAN与扩散声码器。其核心创新在于残差去噪与子建模,其中每个子模型逐步细化波形。在多说话人数据集上进行实验,结果表明我们的方法有效:(1)GAN-WaveNeXt 2比HiFi-GAN和WaveFit快得多;(2)Diff-WaveNeXt 2在FastDiff的4步推理下,推理速度也更快,合成质量相当。Diff-WaveNeXt 2非常训练高效,在仅32小时内即可完成训练,适用于资源受限的应用场景。

关键词

引用

@article{arxiv.2605.25506,
  title  = {WaveNeXt 2: ConvNeXt-Based Fast Neural Vocoders With Residual Denoising and Sub-Modeling for GAN and Diffusion Models},
  author = {Wangzixi Zhou and Takuma Okamoto and Yamato Ohtani and Sakriani Sakti and Hisashi Kawai},
  journal= {arXiv preprint arXiv:2605.25506},
  year   = {2026}
}

备注

ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)