中文

DPT-FSNet: 基于双路径Transformer的全频带与子频带融合语音增强网络

声音 2022-01-26 v2 音频与语音处理

摘要

子频带模型因能建模频谱图中的局部模式而取得了有前景的结果。一些研究通过融合子频带和全频带信息进一步提升了性能。然而,全频带与子频带融合模型的结构尚未被充分探索。本文提出一种基于双路径Transformer的全频带与子频带融合网络(DPT-FSNet),用于频域语音增强。双路径Transformer的帧内和帧间部分分别建模子频带和全频带信息。我们提出的方法所使用的特征比时域双路径Transformer所使用的特征更具可解释性。我们在Voice Bank + DEMAND和Interspeech 2020深度噪声抑制(DNS)数据集上进行了实验以评估所提方法。实验结果表明,所提方法优于当前最先进水平。

关键词

引用

@article{arxiv.2104.13002,
  title  = {DPT-FSNet: Dual-path Transformer Based Full-band and Sub-band Fusion Network for Speech Enhancement},
  author = {Feng Dang and Hangting Chen and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2104.13002},
  year   = {2022}
}

备注

Accepted by ICASSP 2022