用于端侧声学场景分类的跨任务预训练
声音
2020-10-27 v2 机器学习
音频与语音处理
摘要
声学场景分类(ASC)与声学事件检测(AED)是不同但相关的任务。声学事件可为识别声学场景提供有用信息。然而,大多数数据集未提供声学事件或场景标签。为利用声学事件信息提升 ASC 任务性能,我们提出跨任务预训练机制,该机制利用来自预训练 AED 模型的声学事件信息用于 ASC 任务。另一方面,大多数模型在设计实现时依托计算资源丰富的平台,端侧应用受限。为解决此问题,我们采用模型蒸馏方法压缩跨任务模型以实现端侧声学场景分类。本文中,跨任务模型及其学生模型在两个数据集上训练与评估:TAU Urban Acoustic Scenes 2019 数据集与 TUT Acoustic Scenes 2017 数据集。结果表明跨任务预训练机制可显著提升 ASC 任务性能。我们最优模型在 TAU Urban Acoustic Scenes 2019 数据集上相对提升 9.5%,在 TUT Acoustic Scenes 2017 数据集上较官方基线提升 10%。同时,学生模型性能远优于无教师模型。
引用
@article{arxiv.1910.09935,
title = {Cross-task pre-training for on-device acoustic scene classification},
author = {Ruixiong Zhang and Wei Zou and Xiangang Li},
journal= {arXiv preprint arXiv:1910.09935},
year = {2020}
}
备注
presented at Interspeech workshop 2020