中文

用于音频标注的语句内相似性保持知识蒸馏

音频与语音处理 2020-09-04 v1 声音

摘要

知识蒸馏(KD)是一种流行的研究方向,用于在保持良好性能的同时缩减大型模型的规模。较大教师模型的输出被用于指导较小学生模型的训练。鉴于声学事件的重复性,我们提议利用该信息来调节音频标注的 KD 训练。这种新颖的 KD 方法“语句内相似性保持 KD”(IUSP)在音频标注任务上展现出有前景的结果。它受先前发表的 KD 方法“相似性保持 KD”(SP)的启发。然而,与在 mini-batch 内保持输入间的两两相似性不同,我们的方法保持单个输入语句各帧之间的两两相似性。我们提出的 KD 方法 IUSP 在 DCASE 2019 Task 5 音频标注数据集上,针对不同规模的学生模型,相比 SP 均表现出一致的提升。相对于 SP 相对基线的提升,micro AUPRC 相对基线的提升增加了 27.1% 至 122.4%。

关键词

引用

@article{arxiv.2009.01759,
  title  = {Intra-Utterance Similarity Preserving Knowledge Distillation for Audio Tagging},
  author = {Chun-Chieh Chang and Chieh-Chi Kao and Ming Sun and Chao Wang},
  journal= {arXiv preprint arXiv:2009.01759},
  year   = {2020}
}

备注

Accepted to Interspeech 2020