中文

Fast FullSubNet:加速单通道语音增强的全频带与子频带融合模型

音频与语音处理 2023-03-08 v2 信号处理

摘要

FullSubNet是我们最近提出的实时单通道语音增强网络,在深度噪声抑制(Deep Noise Suppression, DNS)挑战数据集上取得了卓越性能。FullSubNet的许多变体已被提出,但它们都专注于结构设计以获得更好性能,很少关注计算效率。对于许多语音增强应用而言,一个关键特性是系统运行在实时、延迟敏感、电池供电的平台上,这严格限制了算法的延迟和计算复杂度。在这项工作中,我们提出了一种名为Fast FullSubNet的新架构,专门用于加速FullSubNet的计算。具体来说,Fast FullSubNet通过使用级联的线性到梅尔全频带、子频带和梅尔到线性全频带模型,在梅尔频率域处理子频带语音频谱,从而大幅减少了子频带计算中涉及的频率。之后,我们提出了一种针对子频带输入序列的下采样操作,以进一步降低沿时间轴的计算复杂度。实验结果表明,与FullSubNet相比,Fast FullSubNet仅具有13%的计算复杂度和16%的处理时间,并实现了相当甚至更好的性能。代码和音频样本可在https://github.com/Audio-WestlakeU/FullSubNet获取。

关键词

引用

@article{arxiv.2212.09019,
  title  = {Fast FullSubNet: Accelerate Full-band and Sub-band Fusion Model for Single-channel Speech Enhancement},
  author = {Xiang Hao and Xiaofei Li},
  journal= {arXiv preprint arXiv:2212.09019},
  year   = {2023}
}