用于DCASE 2022任务4的声事件检测Transformer与帧级模型混合系统
声音
2022-10-19 v1 机器学习
音频与语音处理
摘要
本文详细描述我们用于DCASE 2022 Task 4的系统。该系统结合了两个差异显著的模型:端到端声事件检测Transformer(SEDT)与帧级模型Metric Learning and Focal Loss CNN(MLFL-CNN)。前者为事件级模型,学习事件级表示并直接预测声事件类别与边界;后者基于广泛采用的帧分类方案,每帧被分类为事件类别,并通过阈值化与平滑等后处理获得事件边界。对于SEDT,应用了使用无标签数据的自监督预训练,并采用在线教师进行半监督学习,该教师由学生模型使用指数移动平均(EMA)策略更新,并为弱标签与无标签数据生成可靠的伪标签。对于帧级模型,使用了DCASE 2021 Task 4的ICT-TOSHIBA系统。实验结果表明,该混合系统显著优于任一单独模型,并在无外部数据的验证集上取得psds1为0.420、psds2为0.783的结果。代码见https://github.com/965694547/Hybrid-system-of-frame-wise-model-and-SEDT。
引用
@article{arxiv.2210.09529,
title = {A Hybrid System of Sound Event Detection Transformer and Frame-wise Model for DCASE 2022 Task 4},
author = {Yiming Li and Zhifang Guo and Zhirong Ye and Xiangdong Wang and Hong Liu and Yueliang Qian and Rui Tao and Long Yan and Kazushige Ouchi},
journal= {arXiv preprint arXiv:2210.09529},
year = {2022}
}
备注
5 pages, 2 figures, accepted for publication in DCASE2022 Workshop