跨谱域实时语音增强的两阶段框架
音频与语音处理
2024-01-22 v1 声音
摘要
由于优于传统的单阶段方法,两阶段流水线在语音增强任务中很受欢迎。当前的两阶段方法通常在第一阶段增强幅度谱,并在第二阶段进一步修改复数谱以抑制残余噪声并恢复语音相位。上述整个过程在短时傅里叶变换(STFT)谱域中执行。在本文中,我们在短时离散余弦变换(STDCT)谱域中重新实现上述第二个子过程。原因是我们发现 STDCT 比 STFT 具有更强的噪声抑制能力。此外,STDCT 的隐式相位确保了更简单高效的相位恢复,而这在基于 STFT 的方法中具有挑战性且计算成本高。因此,我们提出了一种名为 STFT-STDCT 谱融合网络(FDFNet)的新型两阶段框架,用于跨谱域语音增强。实验结果表明,所提出的 FDFNet 优于以前的两阶段方法,并且与其他先进系统相比也展现出优越的性能。
引用
@article{arxiv.2401.10494,
title = {A Two-Stage Framework in Cross-Spectrum Domain for Real-Time Speech Enhancement},
author = {Yuewei Zhang and Huanbin Zou and Jie Zhu},
journal= {arXiv preprint arXiv:2401.10494},
year = {2024}
}
备注
Accepted by ICASSP 2024