通过余弦距离的潜在表示对齐进行语音降噪的知识蒸馏
声音
2025-05-07 v1 机器学习
音频与语音处理
摘要
语音降噪是一项被广泛采用且影响深远的任务,出现在许多常见和日常生活的用例中。尽管已经发表了非常强大的方法,但其中大多数过于复杂,无法部署在日常和低资源的计算环境中,如手持设备、智能眼镜、助听器等。知识蒸馏(KD)是缓解这种复杂性不匹配的突出方法,它基于将知识从预训练的复杂模型(教师模型)迁移/蒸馏到另一个不那么复杂的模型(学生模型)。现有的用于语音降噪的KD方法基于一些过程,这些过程可能通过将学生的学习限制在教师模型学习到的分布、信息排序和特征维度上,从而阻碍了KD。在本文中,我们提出并评估了一种试图解决这个问题的方法,该方法利用了众所周知的降噪自编码器框架、线性倒置瓶颈以及余弦相似度的性质。我们使用一个公共数据集,并在教师和学生模型之间不同的不匹配场景下进行了重复实验,报告了我们方法和另一种用作基线的先进方法的指标均值和标准差。我们的结果表明,使用所提出的方法,学生模型可以表现更好,并且与教师模型相比,也能承受更大的不匹配条件。
引用
@article{arxiv.2505.03442,
title = {Knowledge Distillation for Speech Denoising by Latent Representation Alignment with Cosine Distance},
author = {Diep Luong and Mikko Heikkinen and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2505.03442},
year = {2025}
}