AST-SED:一种基于音频频谱Transformer的有效声音事件检测方法
音频与语音处理
2023-03-08 v1 声音
摘要
在本文中,我们提出了一种基于音频频谱Transformer (AST) 模型的有效声音事件检测 (SED) 方法,该模型在大规模AudioSet上预训练以用于音频标注 (AT) 任务,称为AST-SED。预训练的AST模型最近在DCASE2022挑战赛任务4中展现出潜力,有助于缓解真实标注数据不足的问题。然而,主要由于AT与SED任务之间的差异,直接利用预训练AST模型的输出是次优的。因此,所提出的AST-SED采用编码器-解码器架构,以实现有效且高效微调,而无需重新设计或重新训练AST模型。具体而言,频率维Transformer编码器 (FTE) 由沿频率轴具有自注意力的Transformer组成,以解决单段剪辑中多个重叠音频事件的问题。局部门控循环单元解码器 (LGD) 由最近邻插值 (NNI) 和双向门控循环单元 (Bi-GRU) 组成,以补偿预训练AST模型输出中的时间分辨率损失。在DCASE2022任务4开发集上的实验结果证明了所提出的具有FTE-LGD架构的AST-SED的优越性。具体而言,基于事件的F1分数 (EB-F1) 为59.60%,以及多音声音检测分数场景1 (PSDS1) 为0.5140,显著优于CRNN和其他基于预训练AST的系统。
引用
@article{arxiv.2303.03689,
title = {AST-SED: An Effective Sound Event Detection Method Based on Audio Spectrogram Transformer},
author = {Kang Li and Yan Song and Li-Rong Dai and Ian McLoughlin and Xin Fang and Lin Liu},
journal= {arXiv preprint arXiv:2303.03689},
year = {2023}
}
备注
accepted to ICASSP 2023