面向异构数据集的声事件检测 Transformer 多迭代多阶段微调
音频与语音处理
2024-07-19 v1
摘要
构建有效声事件检测系统的核心问题在于缺乏高质量、标注严谨的声事件数据集。为此,DCASE 2024 挑战赛的 Task 4 提出学习来自两个异构数据集的方案,这些数据集包含标注粒度不同的音频剪辑且事件集合不同。我们提出一种针对 Audio Spectrogram Transformers 对 DESED 和 MAESTRO Real 数据集进行多迭代多阶段微调的方案。第一阶段 closely 匹配基线系统设置,训练 CRNN 模型同时保持预训练变换器模型冻结。在第二阶段,使用重大加权的自监督损失对 CRNN 和变换器进行微调。第二阶段之后,我们利用微调后变换器的集成生成训练集所有音频剪辑的强伪标签。随后,在第二次迭代中,我们重复两阶段训练过程,并加入基于伪标签的蒸馏损失,实现在 DESED 公开评估集上取得新的单模型最佳性能(PSDS1 为 0.692)。基于我们提出的训练程序的单模型和集成模型在 DCASE 2024 挑战赛 Task 4 中名列第一。
引用
@article{arxiv.2407.12997,
title = {Multi-Iteration Multi-Stage Fine-Tuning of Transformers for Sound Event Detection with Heterogeneous Datasets},
author = {Florian Schmid and Paul Primus and Tobias Morocutti and Jonathan Greif and Gerhard Widmer},
journal= {arXiv preprint arXiv:2407.12997},
year = {2024}
}
备注
Code: https://github.com/CPJKU/cpjku_dcase24