SRTNet:基于随机精炼的时域语音增强
声音
2022-11-01 v1 音频与语音处理
摘要
扩散模型作为一种在图像生成与音频合成中非常流行的新型生成模型,很少被用于语音增强。本文中,我们将扩散模型用作随机精炼模块。我们提出 SRTNet,一种在完整时域中通过随机精炼(Stochastic Refinement)进行语音增强的新方法。具体而言,我们设计了一个由确定性模块与随机模块组成的联合网络,构成“增强-精炼”范式。我们从理论上论证了方法的可行性,并通过实验证明该方法实现了更快的训练、更快的采样与更高质量。我们的代码与增强样本可在 https://github.com/zhibinQiu/SRTNet.git 获取。
引用
@article{arxiv.2210.16805,
title = {SRTNet: Time Domain Speech Enhancement Via Stochastic Refinement},
author = {Zhibin Qiu and Mengfan Fu and Yinfeng Yu and LiLi Yin and Fuchun Sun and Hao Huang},
journal= {arXiv preprint arXiv:2210.16805},
year = {2022}
}