Fast FullSubNet:加速单通道语音增强的全频带与子频带融合模型
音频与语音处理
2023-03-08 v2 信号处理
摘要
FullSubNet是我们最近提出的实时单通道语音增强网络,在深度噪声抑制(Deep Noise Suppression, DNS)挑战数据集上取得了卓越性能。FullSubNet的许多变体已被提出,但它们都专注于结构设计以获得更好性能,很少关注计算效率。对于许多语音增强应用而言,一个关键特性是系统运行在实时、延迟敏感、电池供电的平台上,这严格限制了算法的延迟和计算复杂度。在这项工作中,我们提出了一种名为Fast FullSubNet的新架构,专门用于加速FullSubNet的计算。具体来说,Fast FullSubNet通过使用级联的线性到梅尔全频带、子频带和梅尔到线性全频带模型,在梅尔频率域处理子频带语音频谱,从而大幅减少了子频带计算中涉及的频率。之后,我们提出了一种针对子频带输入序列的下采样操作,以进一步降低沿时间轴的计算复杂度。实验结果表明,与FullSubNet相比,Fast FullSubNet仅具有13%的计算复杂度和16%的处理时间,并实现了相当甚至更好的性能。代码和音频样本可在https://github.com/Audio-WestlakeU/FullSubNet获取。
引用
@article{arxiv.2212.09019,
title = {Fast FullSubNet: Accelerate Full-band and Sub-band Fusion Model for Single-channel Speech Enhancement},
author = {Xiang Hao and Xiaofei Li},
journal= {arXiv preprint arXiv:2212.09019},
year = {2023}
}