用于设备端音频分类的时间知识蒸馏
声音
2022-02-08 v2 机器学习
音频与语音处理
摘要
鉴于移动环境的计算限制,提升设备端音频分类模型的性能仍是一项挑战。许多研究利用知识蒸馏,通过将大模型的知识迁移到设备端模型来提升预测性能。然而,大多数缺乏一种机制来蒸馏对音频分类任务至关重要的时间信息本质,或常常要求相似架构。本文提出一种新的知识蒸馏方法,旨在将基于大型transformer的模型的注意力权重中所嵌入的时间知识融入设备端模型。我们的蒸馏方法适用于多种架构,包括基于非注意力的架构如CNN或RNN,同时在推理时保留原始网络架构。通过在音频事件检测数据集和含噪关键词 spotting 数据集上的大量实验,我们表明所提方法提升了多种设备端架构上的预测性能。
引用
@article{arxiv.2110.14131,
title = {Temporal Knowledge Distillation for On-device Audio Classification},
author = {Kwanghee Choi and Martin Kersner and Jacob Morton and Buru Chang},
journal= {arXiv preprint arXiv:2110.14131},
year = {2022}
}
备注
ICASSP 2022