面向幅度保持网络架构的扩散基 speech enhancement 是否需要 EMA?
音频与语音处理
2026-01-30 v3 声音
摘要
我们采用 Schrodinger 桥公式研究基于扩散的语音增强方法,并将 EDM2 框架扩展至此场景。我们对网络输入输出进行时序依赖 preconditioning,以稳定训练过程,并探讨两种 skip 连接配置,使网络能够预测环境噪声或干净语音。为控制激活和权重幅度,我们采用幅度保持架构,并学习每个网络模块中对噪声输入贡献的权重,以实现更好的条件化。我们进一步分析了指数移动平均 (EMA) 参数平滑的影响,通过近似不同训练后 EMA 配置,发现与图像生成不同,短或无 EMA 一致能获得更佳的语音增强性能。在 VoiceBank-DEMAND 和 EARS-WHAM 数据集上实验表明,两种 skip 连接变体在信噪比和感知评分方面均表现出竞争力,具有互补的优势。这些发现为扩散语音增强中的 EMA 行为、幅度保持及 skip 连接设计提供了新见解。
引用
@article{arxiv.2505.05216,
title = {Do We Need EMA for Diffusion-Based Speech Enhancement? Toward a Magnitude-Preserving Network Architecture},
author = {Julius Richter and Danilo de Oliveira and Timo Gerkmann},
journal= {arXiv preprint arXiv:2505.05216},
year = {2026}
}
备注
Accepted at ICASSP 2026