用于音频标注的语句内相似性保持知识蒸馏
音频与语音处理
2020-09-04 v1 声音
摘要
知识蒸馏(KD)是一种流行的研究方向,用于在保持良好性能的同时缩减大型模型的规模。较大教师模型的输出被用于指导较小学生模型的训练。鉴于声学事件的重复性,我们提议利用该信息来调节音频标注的 KD 训练。这种新颖的 KD 方法“语句内相似性保持 KD”(IUSP)在音频标注任务上展现出有前景的结果。它受先前发表的 KD 方法“相似性保持 KD”(SP)的启发。然而,与在 mini-batch 内保持输入间的两两相似性不同,我们的方法保持单个输入语句各帧之间的两两相似性。我们提出的 KD 方法 IUSP 在 DCASE 2019 Task 5 音频标注数据集上,针对不同规模的学生模型,相比 SP 均表现出一致的提升。相对于 SP 相对基线的提升,micro AUPRC 相对基线的提升增加了 27.1% 至 122.4%。
引用
@article{arxiv.2009.01759,
title = {Intra-Utterance Similarity Preserving Knowledge Distillation for Audio Tagging},
author = {Chun-Chieh Chang and Chieh-Chi Kao and Ming Sun and Chao Wang},
journal= {arXiv preprint arXiv:2009.01759},
year = {2020}
}
备注
Accepted to Interspeech 2020