基于 mixup 的多任务学习与跨任务融合的环境声音分析
声音
2021-03-31 v1 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
环境声音分析目前正受到越来越多的关注。在该领域中,声学场景分类与声学事件分类是两个紧密相关的任务。本文提出一种针对上述任务的两阶段方法。第一阶段,提出一种基于 mixup 的 MTL 方案,在单一卷积神经网络中同时分类两项任务。在 MTL 模型的训练中使用人工多标签样本,这些样本由现有单任务数据集混合得到。所得多任务模型能有效识别声学场景与事件。与重新标注或合成等方法相比,基于 mixup 的 MTL 成本低、灵活且有效。第二阶段,将 MTL 模型修改为单任务模型,并使用对应特定任务的原始数据集进行微调。通过仔细控制冻结层,融合任务特定的高层特征,进一步提升单分类任务的性能。所提方法证实了声学场景分类与声学事件分类的互补特性。最后,经集成学习增强,在 TUT acoustic scene 2017 数据集上取得 84.5% 的准确率,在 ESC-50 数据集上取得 77.5% 的准确率。
引用
@article{arxiv.2103.16079,
title = {Environmental sound analysis with mixup based multitask learning and cross-task fusion},
author = {Weiping Zheng and Dacan Jiang and Gansen Zhao},
journal= {arXiv preprint arXiv:2103.16079},
year = {2021}
}
备注
5 pages, 1 figue