中文

面向移动设备的轻量级全带语音降噪 DNN:利用长短时模式

音频与语音处理 2025-09-08 v1 机器学习 声音 信号处理

摘要

语音降噪(SD)是许多现代信号处理链中重要的任务,广泛应用于设备和日常生活场景。尽管已有大量发表且功能强大的深度神经网络(DNN)方法用于 SD,但鲜有针对诸如移动设备等资源受限平台进行优化。此外,大多数 DNN-based 方法未聚焦于全带(FB)信号(即 48 kHz 采样率),或低延迟场景。本文提出一种基于因果、低延迟和轻量级 DNN 的全带 SD 方法,利用短时和长时模式。该方法基于修改后的 UNet 架构,采用回望帧、卷积核的时间跨度以及循环神经网络来挖掘信号和估计降噪掩码中的短时和长时模式。该 DNN 以帧为单位进行因果处理,输入为 STFT 幅度,采用受 MobileNet 启发的 inverted bottleneck 结构,运用因果实例归一化进行通道级归一化,在部署到现代移动手机后实现实时因子低于 0.02。该方法采用既定的语音降噪指标和公开数据集进行评估,展示了在实现 (SI-)SDR 值方面优于现有全带和低延迟 SD 方法的有效性。

关键词

引用

@article{arxiv.2509.05079,
  title  = {Lightweight DNN for Full-Band Speech Denoising on Mobile Devices: Exploiting Long and Short Temporal Patterns},
  author = {Konstantinos Drossos and Mikko Heikkinen and Paschalis Tsiaflakis},
  journal= {arXiv preprint arXiv:2509.05079},
  year   = {2025}
}

备注

Accepted for publication in Proceedings of the 2025 IEEE 27th International Workshop on Multimedia Signal Processing (MMSP)