DCHT:用于语音增强的深度复数混合Transformer
声音
2023-10-31 v1 音频与语音处理
摘要
当前大多数基于深度学习的语音增强方法仅在谱图或波形域中运行。尽管已有结合波形域与谱图域输入的跨域Transformer被提出,其性能仍有进一步提升空间。本文提出一种新颖的深度复数混合Transformer,它整合谱图域与波形域方法以改善语音增强性能。所提模型由两部分组成:谱图域中的复数Swin-Unet与波形域中的双路径Transformer网络(DPTnet)。我们首先在谱图域中构建复数Swin-Unet网络,并在复数音频谱中进行语音增强。随后通过引入记忆压缩注意力来改进DPT。我们的模型能够以一种互补的方式学习多域特征,从而在不同域上降低已有噪声。在BirdSoundsDenoising数据集与VCTK+DEMAND数据集上的实验结果表明,与SOTA方法相比,我们的方法能取得更优性能。
引用
@article{arxiv.2310.19602,
title = {DCHT: Deep Complex Hybrid Transformer for Speech Enhancement},
author = {Jialu Li and Junhui Li and Pu Wang and Youshan Zhang},
journal= {arXiv preprint arXiv:2310.19602},
year = {2023}
}
备注
IEEE DDP conference