中文

基于粗糙预测池化和声学事件包围盒的自训练与集成频率依赖网络

音频与语音处理 2024-09-23 v2 声音

摘要

为解决声音事件检测(SED)问题,我们提出了频率依赖网络(FreDNets),大量依赖于频率依赖方法。我们应用了频率变形和FilterAugment,这些是频率依赖的数据增强方法。模型体系结构由3个分支构成:音频教师学生变换(ATST)分支、BEATs分支和CNN分支,其中包括要么部分稀疏频率动态卷积(PDFD conv),要么结合时间帧频率注意力(SE)(tfwSE)。为了训练带有粗糙时间分辨率的maeistro标签,我们对预测应用了最大池化。使用最佳集成模型,我们应用自训练获取来自DESED弱标签集、未标记集和AudioSet的伪标签。筛选后聚焦于高置信度标签的AudioSet伪标签用于训练DESED数据集。我们使用基于变更检测的声学事件包围盒(cSEBB)作为自训练和提交模型的后处理。最终得到的FreDNet在DCASE 2024挑战任务4中名列第2。

关键词

引用

@article{arxiv.2406.15725,
  title  = {Self Training and Ensembling Frequency Dependent Networks with Coarse Prediction Pooling and Sound Event Bounding Boxes},
  author = {Hyeonuk Nam and Deokki Min and Seungdeok Choi and Inhan Choi and Yong-Hwa Park},
  journal= {arXiv preprint arXiv:2406.15725},
  year   = {2024}
}

备注

DCASE 2024 Challenge Task 4 technical report, DCASE 2024 Workshop accepted