利用局部与全局知识融合的时频校准蒸馏用于语音增强
声音
2026-05-18 v3 音频与语音处理
摘要
在本文中,我们提出了一种集合内与集合间递归融合框架,结合时频校准知识蒸馏 (ISRF-TFCKD) 用于语音增强 (SE)。与以往语音增强的蒸馏策略不同,所提出的框架充分利用语音的时频差分信息,同时促进局部信息聚焦与全局知识流通。首先,我们为集合内与集合间相关性构建了协作蒸馏范式。在相关集合内,多层教师-学生特征进行成对匹配以实现校准蒸馏。随后,我们通过递归融合从每个相关集合生成代表性特征,形成融合特征集以实现集合间知识交互。其次,我们提出了基于双流时频交叉校准的多层交互蒸馏,分别计算教师-学生在时域和频域的相似度校准权重并进行交叉加权,从而根据语音特征在不同层之间实现精细的蒸馏贡献分配。所提出的蒸馏策略应用于在 L3DAS23 挑战赛语音增强赛道排名第一的双路径扩张卷积循环网络 (DPDCRN)。为了评估 ISRF-TFCKD 的有效性,我们在单通道与多通道 SE 数据集上进行了实验。客观评估表明,所提出的蒸馏策略持续有效地提升了低复杂度学生模型的性能,并优于其他蒸馏方案。
引用
@article{arxiv.2506.13127,
title = {Leveraging Local and Global Knowledge Integration with Time-Frequency Calibrated Distillation for Speech Enhancement},
author = {Jiaming Cheng and Ruiyu Liang and Ye Ni and Chao Xu and Jing Li and Wei Zhou and Rui Liu and Björn W. Schuller and Xiaoshuai Hao},
journal= {arXiv preprint arXiv:2506.13127},
year = {2026}
}
备注
submitted to Neural Networks