SpecGrad:基于扩散概率模型并具有自适应噪声谱整形的神经声码器
音频与语音处理
2022-08-08 v2 机器学习
声音
机器学习
摘要
使用去噪扩散概率模型(DDPM)的神经声码器已通过使扩散噪声分布适应给定声学特征而得到改进。在本研究中,我们提出 SpecGrad,其使扩散噪声的时变谱包络接近条件对数梅尔谱图。这种通过时变滤波的适应改善了特别是在高频带的音质。它在时频域中处理,以将计算成本保持在与传统基于 DDPM 的神经声码器几乎相同。实验结果表明,在分析-合成与语音增强两种场景下,SpecGrad 比传统基于 DDPM 的神经声码器生成保真度更高的语音波形。音频演示可在 wavegrad.github.io/specgrad/ 获取。
引用
@article{arxiv.2203.16749,
title = {SpecGrad: Diffusion Probabilistic Model based Neural Vocoder with Adaptive Noise Spectral Shaping},
author = {Yuma Koizumi and Heiga Zen and Kohei Yatabe and Nanxin Chen and Michiel Bacchiani},
journal= {arXiv preprint arXiv:2203.16749},
year = {2022}
}
备注
Accepted to Interspeech 2022