LiSenNet:面向实时语音增强的轻量级亚段双路径建模
音频与语音处理
2024-09-23 v1 声音
信号处理
摘要
语音增强(SE)旨在从噪声污染的测量中提取干净的波形,以提高语音质量和可理解性。尽管基于学习的方法在性能上远优于传统方法,但其大的计算复杂度和模型大小严重限制了在延迟敏感和低资源边缘设备上的部署。在本工作中,我们提出了一个用于实时应用的轻量级SE网络(LiSenNet)。我们设计了亚段下采样和上采样模块,以及双路径循环模块,以分别捕获带宽感知特征和时频模式。我们开发了一个噪声检测器,用于检测噪声区域,以适当地执行SE,从而节省计算成本。与最近的高资源依赖基线模型相比,提出的LiSenNet仅需37k参数(相当于最新模型的一半),每秒仅需56M次乘加运算(MAC),即可实现竞争性的性能。
引用
@article{arxiv.2409.13285,
title = {LiSenNet: Lightweight Sub-band and Dual-Path Modeling for Real-Time Speech Enhancement},
author = {Haoyin Yan and Jie Zhang and Cunhang Fan and Yeping Zhou and Peiqi Liu},
journal= {arXiv preprint arXiv:2409.13285},
year = {2024}
}
备注
5 pages, submitted to 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)