面向弱监督音频标注与声学事件检测的深度融合特征蒸馏与自适应 focal loss 联合框架
音频与语音处理
2022-02-15 v2 声音
摘要
良好的联合训练框架非常有助于同时提升弱监督音频标注(AT)与声学事件检测(AED)的性能。在本研究中,我们提出三种方法来改进 IEEE AASP 声学场景与事件检测及分类挑战赛(DCASE)2019 任务 4 中针对音频标注与声学事件检测任务的最佳教师-学生框架。首先提出一种基于帧级目标事件的深度特征蒸馏,旨在利用弱监督框架中有限的强标注数据潜力来学习更好的中间特征图。然后,我们提出自适应 focal loss 与两阶段训练策略,以实现有效且更精确的模型训练,其中难与易声学事件对总代价函数的贡献可自动调整。此外,设计了一种事件特定的后处理以改善目标事件时间戳的预测。我们的实验在公开 DCASE 2019 任务 4 数据集上进行,结果表明我们的方法在 AT(81.2\% F1-score)与 AED(49.8\% F1-score)任务中均取得了有竞争力的性能。
引用
@article{arxiv.2103.12388,
title = {Joint framework with deep feature distillation and adaptive focal loss for weakly supervised audio tagging and acoustic event detection},
author = {Yunhao Liang and Yanhua Long and Yijie Li and Jiaen Liang and Yuping Wang},
journal= {arXiv preprint arXiv:2103.12388},
year = {2022}
}
备注
Updated, please refer to "https://sciencedirect.53yu.com/science/article/abs/pii/S105120042200063X"