长上下文建模网络用于单声道语音增强:对比研究
音频与语音处理
2025-07-08 v1
摘要
先进的长上下文建模主干网络,如 Transformer、Conformer 和 Mamba,已在语音增强中展现出领先性能。然而,在统一的语音增强框架中,对这些主干网络进行系统且全面的对比研究仍不足。此外,xLSTM 作为 LSTM 的一种更近期且高效的变体,在语言模型和通用视觉主干方面显示出有前景的成果。本文我们检验 xLSTM 在语音增强中的能力,并在统一框架下,对 Transformer、Conformer、Mamba 和 xLSTM 四种主干网络进行全面比较与分析,考虑到包括因果和非因果配置。总体而言,xLSTM 和 Mamba 的性能优于 Transformer 和 Conformer。Mamba 在训练和推理效率方面表现显著优于 Transformer 和 Conformer,尤其是对于长语音输入;而 xLSTM 的处理速度则最慢。
引用
@article{arxiv.2507.04368,
title = {Long-Context Modeling Networks for Monaural Speech Enhancement: A Comparative Study},
author = {Qiquan Zhang and Moran Chen and Zeyang Song and Hexin Liu and Xiangyu Zhang and Haizhou Li},
journal= {arXiv preprint arXiv:2507.04368},
year = {2025}
}
备注
Accepted by WASPAA 2025, 5 pages