基于半监督学习并利用大核注意力频率动态卷积的 DCASE 2023 任务 4 声音事件检测
音频与语音处理
2023-06-13 v1 声音
摘要
本报告提出了一种结合大核注意力(LKA)的频率动态卷积(FDY)与基于预训练音频 transformer 双向编码器表示(BEATs)嵌入的卷积循环神经网络(CRNN)声音事件检测(SED)模型,采用均值教师与伪标签方法应对 DCASE 2023 任务 4 中标注数据有限的挑战。所提出的 FDY with LKA 集成了 FDY 与 LKA 模块,以有效捕获音频信号中的时频模式、长期依赖关系与高层语义信息。所提出的 FDY with LKA-CRNN 结合 BEATs 嵌入网络首先使用均值教师方法在整个 DCASE 2023 任务 4 数据集上训练,为弱标注、未标注及 AudioSet 生成伪标签。随后,使用相同的伪标签方法对提出的 SED 模型进行再训练。选取其中部分模型提交,在 DCASE 2023 挑战赛任务 4 验证集上展现出更优的 F1 分数与多音 SED 分数性能。
引用
@article{arxiv.2306.06461,
title = {Semi-supervsied Learning-based Sound Event Detection using Freuqency Dynamic Convolution with Large Kernel Attention for DCASE Challenge 2023 Task 4},
author = {Ji Won Kim and Sang Won Son and Yoonah Song and Hong Kook Kim and Il Hoon Song and Jeong Eun Lim},
journal= {arXiv preprint arXiv:2306.06461},
year = {2023}
}
备注
DCASE 2023 Challenge Task 4A, 5 pages