中文

基于多维深度结构化状态空间的小足迹语音增强方法

音频与语音处理 2023-08-28 v1 人工智能 声音 系统与控制 信号处理 系统与控制

摘要

我们提出了一种用于语音增强的多维结构化状态空间(S4)方法。为了更好地捕获沿频率轴的谱依赖关系,我们着重于通过白化变换修改多维 S4 层,以构建新的小足迹模型,同时亦取得良好性能。我们在时域(T)与时频(TF)域探索了若干基于 S4 的深度架构。二维 S4 层可视为一种具有无限感受野的特殊卷积层,尽管其使用的参数少于常规卷积层。在 VoiceBank-DEMAND 数据集上评估,与基于卷积层的常规 U-net 模型相比,所提出的时频域基于 S4 的模型尺寸减小 78.6%,但仍以数据增强取得了 PESQ 分数 3.15 的具竞争力结果。通过增大模型尺寸,我们甚至可达到 PESQ 分数 3.18。

关键词

引用

@article{arxiv.2306.00331,
  title  = {A Multi-dimensional Deep Structured State Space Approach to Speech Enhancement Using Small-footprint Models},
  author = {Pin-Jui Ku and Chao-Han Huck Yang and Sabato Marco Siniscalchi and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2306.00331},
  year   = {2023}
}

备注

Accepted to Interspeech 2023. Code will be released at https://github.com/Kuray107/S4ND-U-Net_speech_enhancement