基于特征知识蒸馏的 Distil-DCCRN:一个小体积 DCCRN
声音
2024-08-09 v1 音频与语音处理
摘要
深度复杂卷积循环网络 (DCCRN) 通过利用音频频谱的复杂特征实现卓越的语音增强性能。然而,它具有大量的模型参数。我们提出了一个更小的模型 Distil-DCCRN,其参数仅为 DCCRN 的 30%。为确保 Distil-DCCRN 的性能与 DCCRN 相当,我们采用知识蒸馏 (KD) 方法,使用更大的教师模型帮助训练更小的学生模型。我们设计了一种知识蒸馿 (KD) 方法,将注意力传递和 Kullback-Leibler 发散 (AT-KL) 集成以训练学生模型 Distil-DCCRN。此外,我们使用性能更好且结构更复杂的 Uformer 作为教师模型。不同于以往 KD 方法主要关注模型输出的做法,我们的方法还利用模型中间层的中间特征,促进了尽管不同层配置和中间特征在通道和时间维度上存在差异的不同结构模型之间进行丰富的知识传递。通过我们的 AT-KL 方法,Distil-DCCRN 在 DNS 测试集上的 PESQ 和 SI-SNR 指标均优于 DCCRN 以及其他多个竞争模型,并在 DNSMOS 上实现与 DCCRN 相当的结果。
引用
@article{arxiv.2408.04267,
title = {Distil-DCCRN: A Small-footprint DCCRN Leveraging Feature-based Knowledge Distillation in Speech Enhancement},
author = {Runduo Han and Weiming Xu and Zihan Zhang and Mingshuai Liu and Lei Xie},
journal= {arXiv preprint arXiv:2408.04267},
year = {2024}
}
备注
Accepted by IEEE Signal Processing Letters