通过多阶段训练改进音频频谱图变换器以实现声音事件检测
音频与语音处理
2024-08-05 v1 声音
摘要
本技术报告描述了CP-JKU团队在DCASE 24挑战赛任务4(异构训练数据集与潜在缺失标签的声音事件检测)中的提交方案。我们对三个大型音频频谱图变换器PaSST、BEATs和ATST进行了微调,在联合DESED和MAESTRO数据集上采用两阶段训练过程。第一阶段与基线系统设置紧密匹配,训练一个CRNN模型,同时保持大型预训练变换器模型冻结。第二阶段使用权重较大的自监督损失同时微调CRNN和变换器。第二阶段结束后,我们利用所有三个微调变换器的集成为训练集中的所有音频片段计算强伪标签。随后,在第二轮迭代中,我们重复两阶段训练过程并加入基于伪标签的蒸馏损失,大幅提升了单模型性能。此外,我们在AudioSet中具有强时间标签的子集上预训练PaSST和ATST,然后再在任务4数据集上进行微调。
引用
@article{arxiv.2408.00791,
title = {Improving Audio Spectrogram Transformers for Sound Event Detection Through Multi-Stage Training},
author = {Florian Schmid and Paul Primus and Tobias Morocutti and Jonathan Greif and Gerhard Widmer},
journal= {arXiv preprint arXiv:2408.00791},
year = {2024}
}
备注
Technical Report describing our system for DCASE2024 Challenge Task 4: https://dcase.community/challenge2024/task-sound-event-detection-with-heterogeneous-training-dataset-and-potentially-missing-labels-results Code: https://github.com/CPJKU/cpjku_dcase24. arXiv admin note: text overlap with arXiv:2407.12997