基于分数扩散的通用语音增强
声音
2022-09-19 v2 机器学习
音频与语音处理
摘要
从语音音频中去除背景噪声一直是备受关注的研究课题,近年来因虚拟通信与业余录音的兴起尤为如此。然而背景噪声并非唯一妨碍可懂度的不良干扰:混响、削波、编解码伪影、不当均衡、带宽受限或不一致响度同样普遍且恼人。本文中,我们主张将语音增强视为一项整体性工作,并提出一种可同时处理55种不同失真类型的通用语音增强系统。我们的方法由一个采用基于分数扩散(score-based diffusion)的生成模型,以及一个利用混合密度网络进行增强的多分辨率条件网络组成。我们表明,在专家听者进行的主观测试中,该方法显著优于当前最优水平。我们还表明,即便未采用任何快速采样策略,仅用4-8次扩散步即可取得具竞争力的客观分数。我们希望我们的方法与技术贡献能鼓励研究者和从业者采用通用路径处理语音增强,或将其构建为生成任务。
引用
@article{arxiv.2206.03065,
title = {Universal Speech Enhancement with Score-based Diffusion},
author = {Joan Serrà and Santiago Pascual and Jordi Pons and R. Oguz Araz and Davide Scaini},
journal= {arXiv preprint arXiv:2206.03065},
year = {2022}
}
备注
24 pages, 6 figures; includes appendix; examples in https://serrjoa.github.io/projects/universe/