基于动态通道修剪的可扩展语音增强
音频与语音处理
2025-05-02 v1 机器学习
声音
摘要
语音增强(Speech Enhancement, SE)对于提高远程协作环境中的生产力至关重要。虽然深度学习模型在语音增强方面效果极佳,但其计算需求使得其在嵌入式系统上难以实用。此外,声学条件在难度上会发生显著变化,而神经网络通常是围绕计算量保持静态的。为了解决这个问题,本文首次将动态通道修剪引入音频领域,并应用于用于语音增强的自定义卷积网络。我们的方法通过在运行时识别不必要的卷积通道,从而节省计算资源,避免对这些通道计算激活值并检索其滤波器。训练仅使用 25% 的通道时,我们在保持 PESQ 仅下降 0.75% 的情况下,节省了 29.6% 的 MAC。因此,DynCP 为在资源受限设备上部署更大更强大的语音增强解决方案提供了可行的路径。
引用
@article{arxiv.2412.17121,
title = {Scalable Speech Enhancement with Dynamic Channel Pruning},
author = {Riccardo Miccini and Clement Laroche and Tobias Piechowiak and Luca Pezzarossa},
journal= {arXiv preprint arXiv:2412.17121},
year = {2025}
}
备注
Accepted for publication at the 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)