中文

SpecGrad:基于扩散概率模型并具有自适应噪声谱整形的神经声码器

音频与语音处理 2022-08-08 v2 机器学习 声音 机器学习

摘要

使用去噪扩散概率模型(DDPM)的神经声码器已通过使扩散噪声分布适应给定声学特征而得到改进。在本研究中,我们提出 SpecGrad,其使扩散噪声的时变谱包络接近条件对数梅尔谱图。这种通过时变滤波的适应改善了特别是在高频带的音质。它在时频域中处理,以将计算成本保持在与传统基于 DDPM 的神经声码器几乎相同。实验结果表明,在分析-合成与语音增强两种场景下,SpecGrad 比传统基于 DDPM 的神经声码器生成保真度更高的语音波形。音频演示可在 wavegrad.github.io/specgrad/ 获取。

关键词

引用

@article{arxiv.2203.16749,
  title  = {SpecGrad: Diffusion Probabilistic Model based Neural Vocoder with Adaptive Noise Spectral Shaping},
  author = {Yuma Koizumi and Heiga Zen and Kohei Yatabe and Nanxin Chen and Michiel Bacchiani},
  journal= {arXiv preprint arXiv:2203.16749},
  year   = {2022}
}

备注

Accepted to Interspeech 2022