中文

微调预训练ATST模型用于声音事件检测

音频与语音处理 2024-01-01 v2 声音

摘要

声音事件检测(SED)常受数据匮乏问题困扰。DCASE2023挑战赛任务4近期的基础系统利用大型预训练自监督学习(SelfSL)模型来缓解此限制,其中预训练模型有助于为SED生成更具判别性的特征。然而,在挑战赛基础系统及多数提交方案中,预训练模型被视为冻结的特征提取器,针对预训练模型的微调鲜有研究。本工作中,我们研究用于SED的预训练模型微调方法。我们首先将新提出的SelfSL模型ATST-Frame引入SED系统。ATST-Frame专为学习音频信号的帧级表征而设计,并在一系列下游任务上取得最先进(SOTA)性能。随后,我们提出一种利用(域内)无标签与有标签SED数据对ATST-Frame进行微调的方法。实验表明,所提方法克服了微调大型预训练网络时的过拟合问题,且我们的SED系统在DCASE挑战赛任务4数据集上取得0.587/0.812 PSDS1/PSDS2分数的新SOTA结果。

关键词

引用

@article{arxiv.2309.08153,
  title  = {Fine-tune the pretrained ATST model for sound event detection},
  author = {Nian Shao and Xian Li and Xiaofei Li},
  journal= {arXiv preprint arXiv:2309.08153},
  year   = {2024}
}

备注

5 pages, 3 figures, camera-ready version for ICASSP 2024