中文

基于全频带-子频带交叉注意力网络的语音增强

声音 2022-11-11 v1 音频与语音处理

摘要

FullSubNet 通过利用全频带和子频带信息,在语音增强方面展现出了良好的性能。然而,FullSubNet 中全频带和子频带之间的关系是通过简单拼接全频带模型和子频带单元的输出来实现的。它仅为子频带单元补充了少量的全局信息,并未考虑全频带与子频带之间的交互。本文提出了一种全频带-子频带交叉注意力(FSCA)模块,以交互式地融合全局和局部信息,并将其应用于 FullSubNet。这个新框架被称为 FS-CANet。此外,与 FullSubNet 不同,所提出的 FS-CANet 通过时间卷积网络(TCN)块优化了全频带提取器,以进一步减小模型大小。在 DNS Challenge - Interspeech 2021 数据集上的实验结果表明,所提出的 FS-CANet 优于其他最先进的语音增强方法,并证明了全频带-子频带交叉注意力的有效性。

关键词

引用

@article{arxiv.2211.05432,
  title  = {Speech Enhancement with Fullband-Subband Cross-Attention Network},
  author = {Jun Chen and Wei Rao and Zilin Wang and Zhiyong Wu and Yannan Wang and Tao Yu and Shidong Shang and Helen Meng},
  journal= {arXiv preprint arXiv:2211.05432},
  year   = {2022}
}

备注

Accepted by InterSpeech 2022. arXiv admin note: text overlap with arXiv:2203.12188