基于复卷积块注意力模块与联合时频损失的单通道语音增强
声音
2024-12-02 v2 机器学习
音频与语音处理
摘要
深度复值 U-Net 结构与卷积循环网络(CRN)结构在单通道语音增强任务中取得了最先进的性能。深度复值 U-Net 与 CRN 均为带有跳跃连接的编码器-解码器结构,其严重依赖于复值卷积层的表征能力。本文提出一种复卷积块注意力模块(CCBAM),通过构建更具信息量的特征来增强复值卷积层的表征能力。CCBAM 是一种轻量且通用的模块,可轻松集成到任意复值卷积层中。我们将 CCBAM 与深度复值 U-Net 和 CRN 相集成,以提升它们在语音增强中的性能。我们进一步提出一种混合损失函数,在时频(TF)域与时域联合优化复值模型。通过集成 CCBAM 与混合损失,我们构建了一个新的端到端(E2E)复值语音增强框架。消融实验与客观评测表明了所提方法的优越性能(https://github.com/modelscope/ClearerVoice-Studio)。
引用
@article{arxiv.2102.01993,
title = {Monaural Speech Enhancement with Complex Convolutional Block Attention Module and Joint Time Frequency Losses},
author = {Shengkui Zhao and Trung Hieu Nguyen and Bin Ma},
journal= {arXiv preprint arXiv:2102.01993},
year = {2024}
}
备注
5 pages, 4 figures, 2 tables, accepted by ICASSP 2021