中文

基于FT-JNF架构的低复杂度多麦克风语音增强中知识蒸馏方法的比较

音频与语音处理 2025-07-28 v1

摘要

近年来,使用深度神经网络的多麦克风语音增强取得了显著进展。然而,许多基于DNN的语音增强算法无法在硬件资源有限的设备上实现。仅通过减少参数数量来降低此类系统的复杂度,往往会导致性能下降。知识蒸馏是一种在保持性能的同时减小DNN模型尺寸的有前景的方法。本文考虑最近提出的频率-时间联合非线性滤波器架构,并研究了几种知识蒸馏方法,用于从大型预训练教师模型中训练更小的学生模型。我们评估了五种知识蒸馏方法,包括直接输出匹配、中间层的自相似性以及融合多层损失。在模拟数据集上使用紧凑型五麦克风阵列进行的实验结果表明,与不使用知识蒸馏的训练相比,三种知识蒸馏方法显著提升了学生模型的性能。一个参数仅为教师模型25%的学生模型,在0 dB信噪比下取得了可比的PESQ分数。此外,模型尺寸最多可减少96%,而PESQ分数仅略有下降。

关键词

引用

@article{arxiv.2507.19208,
  title  = {Comparison of Knowledge Distillation Methods for Low-complexity Multi-microphone Speech Enhancement using the FT-JNF Architecture},
  author = {Robert Metzger and Mattes Ohlenbusch and Christian Rollwage and Simon Doclo},
  journal= {arXiv preprint arXiv:2507.19208},
  year   = {2025}
}

备注

Accepted at the ITG Conference on Speech Communication 2025 in Berlin