用于 DCASE 2021 挑战赛任务 4 的带噪声学生模型与半监督损失函数的自训练方法
声音
2021-07-07 v1 机器学习
音频与语音处理
摘要
本报告提出了一种用于 DCASE 2021 挑战赛任务 4 的多音声学事件检测(SED)方法。所提出的 SED 模型由两阶段组成:一个用于为弱标注或无标注数据提供目标标签的平均教师模型,以及一个基于自训练、用于预测声学事件强标签的噪声学生模型。该平均教师模型以残差卷积循环神经网络(RCRNN)作为教师与学生模型,首先使用来自弱标注数据集、无标注数据集和强标注合成数据集的全部训练数据进行训练。随后,训练好的平均教师模型对弱标注和无标注数据集中的每一个样本预测强标签,并将其送入所提 SED 模型第二阶段的噪声学生模型。此处,噪声学生模型的结构与第一阶段平均教师模型中基于 RCRNN 的学生模型相同。然后,通过加入特征噪声(如时频偏移、mixup、SpecAugment 和基于 dropout 的模型噪声)对其进行自训练。此外,应用半监督损失函数来训练噪声学生模型,其起到标签噪声注入的作用。所提 SED 模型的性能在 DCASE 2021 挑战赛任务 4 的验证集上进行了评估,最终选取了将具有不同半监督损失函数超参数的五折验证模型进行组合的若干集成模型作为我们的最终模型。
引用
@article{arxiv.2107.02569,
title = {Self-training with noisy student model and semi-supervised loss function for dcase 2021 challenge task 4},
author = {Nam Kyun Kim and Hong Kook Kim},
journal= {arXiv preprint arXiv:2107.02569},
year = {2021}
}
备注
5 pages, DCASE 2021 challenge Task 4 technical report