基于方差保持的插值扩散模型用于语音增强
音频与语音处理
2023-09-19 v2 人工智能
声音
摘要
本研究的目标是实现用于语音增强(SE)的扩散模型。第一步是阐述连续条件下基于方差保持(VP)的插值扩散的理论基础。随后,我们提出一个更简洁的框架,该框架囊括了基于 VP 与方差爆炸(VE)的插值扩散方法。我们证明这两种方法是所提框架的特例。此外,我们给出了一个用于 SE 任务的基于 VP 的插值扩散的实例。为提升性能并简化模型训练,我们分析了扩散模型中常见的困难并给出了适宜的超参数。最后,我们使用公开基准将我们的模型与若干方法进行比较,以展示我们方法的有效性。
引用
@article{arxiv.2306.08527,
title = {Variance-Preserving-Based Interpolation Diffusion Models for Speech Enhancement},
author = {Zilu Guo and Jun Du and Chin-Hui Lee and Yu Gao and Wenbin Zhang},
journal= {arXiv preprint arXiv:2306.08527},
year = {2023}
}