CMGAN:基于 Conformer 的度量 GAN 用于单通道语音增强
声音
2024-05-07 v3 人工智能
机器学习
音频与语音处理
摘要
在本工作中,我们进一步开发了基于 conformer 的度量生成对抗网络(CMGAN)模型,用于时频(TF)域的语音增强(SE)。本文建立在先前工作基础上,但通过针对模型输入与架构设计选择进行大量消融研究进行了更深入的考察。我们严格测试了模型对未见噪声类型与失真的泛化能力。我们通过 DNS-MOS 测量与试听测试巩固了我们的论断。我们不仅专注于语音去噪任务,还将本工作扩展至解决去混响与超分辨率任务。这有必要探索多种架构改变,特别是度量判别器分数与掩码技术。需着重指出,这是最早尝试复杂 TF 域超分辨率的工作之一。我们的结果表明,CMGAN 在三大语音增强任务——去噪、去混响与超分辨率中均优于现有 SOTA 方法。例如,在使用 Voice Bank+DEMAND 数据集的去噪任务中,CMGAN 显著超越先前模型性能,取得 PESQ 分数 3.41 与 SSNR 11.10 dB。音频样本与 CMGAN 实现已在线提供。
引用
@article{arxiv.2209.11112,
title = {CMGAN: Conformer-Based Metric-GAN for Monaural Speech Enhancement},
author = {Sherif Abdulatif and Ruizhe Cao and Bin Yang},
journal= {arXiv preprint arXiv:2209.11112},
year = {2024}
}
备注
17 pages, 11 figures, and 6 tables. arXiv admin note: text overlap with arXiv:2203.15149