Hodge and Podge:基于多热 MixMatch 与组合一致性训练的混合监督声音事件检测
声音
2020-02-17 v1 音频与语音处理
摘要
在本文中,我们提出一种称为 Hodge and Podge 的声音事件检测方法。我们在声学场景与事件检测及分类(DCASE)2019 挑战赛任务 4 的数据集上展示了 Hodge and Podge。该任务旨在预测家庭环境中声音事件的存在与否及其起止时间。由于缺少大规模真实强标注数据,声音事件检测具有挑战性。近来深度半监督学习(SSL)已被证明能有效地利用弱标注与未标注数据建模。本工作探索如何扩展深度 SSL 以得到一种新颖的、最先进的称为 Hodge and Podge 的声音事件检测方法。以卷积循环神经网络(CRNN)为骨干网络,首先引入并添加多尺度压缩激励机制以生成金字塔压缩激励 CRNN。金字塔压缩激励层能关注不同声音事件具有不同时长的问题,并自适应地重校准通道级频谱图响应。进一步,为弥补真实强标注数据匮乏问题,我们提出具有时频增强的多热 MixMatch 与组合一致性训练。我们使用公开 DCASE2019 挑战赛任务 4 验证数据的实验得到了基于事件的 F-score 为 43.4\%,比挑战赛中最佳方法绝对高出约 1.6\%。而官方基线的 F-score 为 25.8\%。
引用
@article{arxiv.2002.06021,
title = {Hodge and Podge: Hybrid Supervised Sound Event Detection with Multi-Hot MixMatch and Composition Consistence Training},
author = {Ziqiang Shi and Liu Liu and Huibin Lin and Rujie Liu},
journal= {arXiv preprint arXiv:2002.06021},
year = {2020}
}
备注
arXiv admin note: substantial text overlap with arXiv:1907.07398