FRCRN:利用频率循环增强特征表示以实现单通道语音增强
声音
2024-12-02 v3 音频与语音处理
摘要
卷积循环网络(CRN)集成了卷积编码器-解码器(CED)结构与循环结构,在单通道语音增强方面取得了令人瞩目的性能。然而,由于 CED 卷积中感受野有限,跨频率上下文的特征表示受到高度约束。在本文中,我们提出一种卷积循环编码器-解码器(CRED)结构,以增强沿频率轴的特征表示。CRED 在每次卷积后沿频率轴对 3D 卷积特征图应用频率循环,因此能够捕捉长距离频率相关性并增强语音输入的特征表示。所提出的频率循环使用前馈序列记忆网络(FSMN)高效实现。除 CRED 外,我们在编码器与解码器之间插入两层堆叠的 FSMN 层以进一步建模时间动态。我们将所提出的框架命名为频率循环 CRN(FRCRN)。我们设计 FRCRN 以在复数域中预测复数理想比率掩码(cIRM),并使用时频域和时域损失联合优化 FRCRN。我们提出的方法在宽带基准数据集上取得了 state-of-the-art 性能,并在 ICASSP 2022 深度噪声抑制(DNS)挑战赛的实时全频带赛道中按平均意见得分(MOS)和词准确率(WAcc)取得第二名(https://github.com/modelscope/ClearerVoice-Studio)。
引用
@article{arxiv.2206.07293,
title = {FRCRN: Boosting Feature Representation using Frequency Recurrence for Monaural Speech Enhancement},
author = {Shengkui Zhao and Bin Ma and Karn N. Watcharasupat and Woon-Seng Gan},
journal= {arXiv preprint arXiv:2206.07293},
year = {2024}
}
备注
The paper has been accepted by ICASSP 2022. 5 pages, 2 figures, 5 tables