中文

面向语音增强的动态频率自适应知识蒸馏

声音 2025-02-10 v1 音频与语音处理

摘要

深度学习语音增强(SE)模型最近超越了传统技术,但在资源受限设备上部署仍具有挑战性,due to 高计算和内存需求。本文引入一种新颖的动态频率自适应知识蒸馏(DFKD)方法,以有效压缩 SE 模型。我们的方法动态评估模型的输出,区分高频和低频成分,并针对不同频段的独特需求调整学习目标,充分利用 SE 任务的内在特性。为评估 DFKD 的效果,我们在三个最先进的模型上进行了实验:DCCRN、ConTasNet 和 DPTNet。结果表明,我们的方法不仅显著提升了压缩模型(学生模型)的性能,而且在针对 SE 任务的其他基于logit的知识蒸馏方法中也表现更佳。

关键词

引用

@article{arxiv.2502.04711,
  title  = {Dynamic Frequency-Adaptive Knowledge Distillation for Speech Enhancement},
  author = {Xihao Yuan and Siqi Liu and Hanting Chen and Lu Zhou and Jian Li and Jie Hu},
  journal= {arXiv preprint arXiv:2502.04711},
  year   = {2025}
}

备注

5 pages, 2 figures, accepted by ICASSP2025