中文

基于方差保持的插值扩散模型用于语音增强

音频与语音处理 2023-09-19 v2 人工智能 声音

摘要

本研究的目标是实现用于语音增强(SE)的扩散模型。第一步是阐述连续条件下基于方差保持(VP)的插值扩散的理论基础。随后,我们提出一个更简洁的框架,该框架囊括了基于 VP 与方差爆炸(VE)的插值扩散方法。我们证明这两种方法是所提框架的特例。此外,我们给出了一个用于 SE 任务的基于 VP 的插值扩散的实例。为提升性能并简化模型训练,我们分析了扩散模型中常见的困难并给出了适宜的超参数。最后,我们使用公开基准将我们的模型与若干方法进行比较,以展示我们方法的有效性。

关键词

引用

@article{arxiv.2306.08527,
  title  = {Variance-Preserving-Based Interpolation Diffusion Models for Speech Enhancement},
  author = {Zilu Guo and Jun Du and Chin-Hui Lee and Yu Gao and Wenbin Zhang},
  journal= {arXiv preprint arXiv:2306.08527},
  year   = {2023}
}