中文

用于单通道语音增强的脉冲结构化状态空间模型

声音 2024-04-23 v2 计算机视觉与模式识别 音频与语音处理

摘要

语音增强旨在从含噪信号中提取干净语音。传统深度学习方法面临两个挑战:高效利用长语音序列中的信息,以及高计算成本。为应对这些,我们引入脉冲结构化状态空间模型(Spiking-S4)。该方法将脉冲神经网络(Spiking Neural Networks, SNN)的能效与结构化状态空间模型(Structured State Space Models, S4)的长程序列建模能力相融合,提供了一种引人注目的解决方案。在 DNS Challenge 与 VoiceBank+Demand 数据集上的评估证实,Spiking-S4 以更少计算资源媲美现有人工神经网络(Artificial Neural Network, ANN)方法,这由参数量与浮点运算次数(Floating Point Operations, FLOPs)的降低所佐证。

关键词

引用

@article{arxiv.2309.03641,
  title  = {Spiking Structured State Space Model for Monaural Speech Enhancement},
  author = {Yu Du and Xu Liu and Yansong Chua},
  journal= {arXiv preprint arXiv:2309.03641},
  year   = {2024}
}