中文

基于SlowFast框架调制状态空间模型以实现计算效率低延迟语音增强

音频与语音处理 2025-01-07 v2 机器学习 声音

摘要

深度学习方法常在需要满足低延迟要求时面临计算挑战,因为需要处理的帧数增加。本文引入SlowFast框架,旨在在需要低延迟增强时降低计算成本。该框架包含一个以低帧率分析声学环境的慢分支,以及一个以所需更高帧率在时间域内进行语音增强的快分支,以匹配所需延迟。具体而言,快分支采用状态空间模型,其状态转移过程由慢分支动态调制。在Voice Bank + Demand数据集上进行2 ms算法延迟要求的语音增强实验显示,与基线单分支网络相比,本方法在等效参数下降低了70%的计算成本,而不会牺牲增强性能。此外,利用SlowFast框架,我们实现了一个算法延迟仅为62.5微秒(16 kHz采样率下一个采样点)、计算成本为100 M MACs/s的网络,PESQ-NB为3.12,SISNR为16.62。

关键词

引用

@article{arxiv.2411.02019,
  title  = {Modulating State Space Model with SlowFast Framework for Compute-Efficient Ultra Low-Latency Speech Enhancement},
  author = {Longbiao Cheng and Ashutosh Pandey and Buye Xu and Tobi Delbruck and Vamsi Krishna Ithapu and Shih-Chii Liu},
  journal= {arXiv preprint arXiv:2411.02019},
  year   = {2025}
}

备注

Accepted to ICASSP 2025