WTFormer:用于保持空间线索的MIMO语音增强的小波Conformer网络
音频与语音处理
2025-06-30 v1 声音
摘要
当前多通道语音增强系统主要采用单输出结构,在进行多输入多输出(MIMO)处理时,面临着在保持时空信号完整性方面面临重大挑战。为解决这一局限性,我们提出了一种新型神经网络,称为WTFormer,用于MIMO语音增强,利用小波变换的多分辨率特性和多维协作注意力机制,有效捕获全局分布的空间特征,同时使用Conformer进行时频建模。进一步提出了伴随MUSIC算法的多任务损失策略,用于优化训练,以最大程度保护空间信息。在LibriSpeech数据集上的实验结果表明,WTFormer在实现相当程度去噪性能方面,仅需0.98M参数即可保留更多空间信息,性能优于先进系统。
引用
@article{arxiv.2506.22001,
title = {WTFormer: A Wavelet Conformer Network for MIMO Speech Enhancement with Spatial Cues Peservation},
author = {Lu Han and Junqi Zhao and Renhua Peng},
journal= {arXiv preprint arXiv:2506.22001},
year = {2025}
}
备注
Accepted by Interspeech2025