中文

FullSubNet+:用于语音增强的带复谱图的通道注意力 FullSubNet

声音 2022-03-29 v2 人工智能 音频与语音处理

摘要

此前提出的 FullSubNet 在深度噪声抑制(DNS)挑战赛中取得了出色性能并引起广泛关注。然而,它仍存在输入输出不匹配以及对频带处理粗糙等问题。本文中,我们提出一种扩展的单通道实时语音增强框架 FullSubNet+,具有以下显著改进。首先,我们设计了一个轻量多尺度时间敏感通道注意力(MulCA)模块,采用多尺度卷积与通道注意力机制,帮助网络聚焦于更具判别性的频带以降噪。其次,为充分利用带噪语音中的相位信息,我们的模型将所有幅度谱、实部与虚部谱图作为输入。此外,通过将原始全带模型中的长短期记忆(LSTM)层替换为堆叠的时间卷积网络(TCN)块,我们设计了一个更高效的全带模块,称为全带提取器。在 DNS 挑战赛数据集上的实验结果表明,我们的 FullSubNet+ 性能优越,达到了最先进(SOTA)性能并优于其他现有语音增强方法。

关键词

引用

@article{arxiv.2203.12188,
  title  = {FullSubNet+: Channel Attention FullSubNet with Complex Spectrograms for Speech Enhancement},
  author = {Jun Chen and Zilin Wang and Deyi Tuo and Zhiyong Wu and Shiyin Kang and Helen Meng},
  journal= {arXiv preprint arXiv:2203.12188},
  year   = {2022}
}

备注

Accepted by ICASSP 2022