xLSTM-SENet:用于单通道语音增强的xLSTM
声音
2025-05-21 v2 人工智能
音频与语音处理
摘要
虽然基于注意力的架构如Conformer在语音增强方面表现出色,但面临与输入序列长度相关的可扩展性挑战。相比之下,最近提出的扩展长短期记忆(xLSTM)架构具有线性可扩展性。然而,xLSTM-based模型在语音增强领域仍未得到探索。本文介绍xLSTM-SENet,这是首个xLSTM-based单通道语音增强系统。通过对比分析,我们发现xLSTM——甚至是LSTM——在各种模型规模下,能够在VoiceBank+Demand数据集上匹配或超越最先进的Mamba和Conformer-based系统。通过消融研究,我们确定了如指数门控和双向性等关键架构设计选择对其有效性的贡献。我们最佳的xLSTM-based模型xLSTM-SENet2在Voicebank+DEMAND数据集上超越了相似复杂度的最先进Mamba和Conformer-based系统。
引用
@article{arxiv.2501.06146,
title = {xLSTM-SENet: xLSTM for Single-Channel Speech Enhancement},
author = {Nikolai Lund Kühne and Jan Østergaard and Jesper Jensen and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2501.06146},
year = {2025}
}
备注
Accepted at INTERSPEECH 2025