中文

DCHT:用于语音增强的深度复数混合Transformer

声音 2023-10-31 v1 音频与语音处理

摘要

当前大多数基于深度学习的语音增强方法仅在谱图或波形域中运行。尽管已有结合波形域与谱图域输入的跨域Transformer被提出,其性能仍有进一步提升空间。本文提出一种新颖的深度复数混合Transformer,它整合谱图域与波形域方法以改善语音增强性能。所提模型由两部分组成:谱图域中的复数Swin-Unet与波形域中的双路径Transformer网络(DPTnet)。我们首先在谱图域中构建复数Swin-Unet网络,并在复数音频谱中进行语音增强。随后通过引入记忆压缩注意力来改进DPT。我们的模型能够以一种互补的方式学习多域特征,从而在不同域上降低已有噪声。在BirdSoundsDenoising数据集与VCTK+DEMAND数据集上的实验结果表明,与SOTA方法相比,我们的方法能取得更优性能。

关键词

引用

@article{arxiv.2310.19602,
  title  = {DCHT: Deep Complex Hybrid Transformer for Speech Enhancement},
  author = {Jialu Li and Junhui Li and Pu Wang and Youshan Zhang},
  journal= {arXiv preprint arXiv:2310.19602},
  year   = {2023}
}

备注

IEEE DDP conference