中文

WTFormer:用于保持空间线索的MIMO语音增强的小波Conformer网络

音频与语音处理 2025-06-30 v1 声音

摘要

当前多通道语音增强系统主要采用单输出结构,在进行多输入多输出(MIMO)处理时,面临着在保持时空信号完整性方面面临重大挑战。为解决这一局限性,我们提出了一种新型神经网络,称为WTFormer,用于MIMO语音增强,利用小波变换的多分辨率特性和多维协作注意力机制,有效捕获全局分布的空间特征,同时使用Conformer进行时频建模。进一步提出了伴随MUSIC算法的多任务损失策略,用于优化训练,以最大程度保护空间信息。在LibriSpeech数据集上的实验结果表明,WTFormer在实现相当程度去噪性能方面,仅需0.98M参数即可保留更多空间信息,性能优于先进系统。

关键词

引用

@article{arxiv.2506.22001,
  title  = {WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation},
  author = {Lu Han and Junqi Zhao and Renhua Peng},
  journal= {arXiv preprint arXiv:2506.22001},
  year   = {2025}
}

备注

Accepted by Interspeech2025