CMGAN:基于 Conformer 的度量 GAN 用于语音增强
声音
2024-05-07 v4 人工智能
机器学习
音频与语音处理
摘要
近来,卷积增强型 transformer(Conformer)在自动语音识别(ASR)与时域语音增强(SE)中取得了令人瞩目的性能,因其能够捕获语音信号中的局部与全局依赖。本文提出一种基于 Conformer 的度量生成对抗网络(CMGAN),用于时频(TF)域的语音增强。在生成器中,我们利用两阶段 Conformer 块,通过建模时间与频率依赖来聚合所有幅度与复数谱图信息。幅度与复数谱图的估计在解码器阶段解耦,随后联合融合以重建增强语音。此外,采用度量判别器,通过依据相应评价指标优化生成器,进一步提升增强估计语音的质量。在 Voice Bank+DEMAND 数据集上的定量分析表明,CMGAN 以一定优势超越多种先前模型,即 PESQ 达 3.41、SSNR 达 11.10 dB。
引用
@article{arxiv.2203.15149,
title = {CMGAN: Conformer-based Metric GAN for Speech Enhancement},
author = {Ruizhe Cao and Sherif Abdulatif and Bin Yang},
journal= {arXiv preprint arXiv:2203.15149},
year = {2024}
}
备注
5 pages, 1 figure, 2 tables, published in INTERSPEECH 2022