用于DCASE2023挑战中真实场景声音事件定位与检测的分离式谱-时注意力
音频与语音处理
2023-06-06 v1
摘要
在不同房间环境中定位声音并检测事件是一项困难任务,主要由于广泛的反射与混响。当仅用少数房间环境录制的声音训练神经网络模型时,模型往往过度适应这些特定环境,导致过拟合。为解决该过拟合问题,我们提出分离式谱-时注意力。相较于采用卷积循环神经网络(CRNN)后接时序多头自注意力层(MHSA)的基线方法,我们引入独立的谱注意力层,在时序MHSA之前聚合谱特征。为实现高效的谱注意力,我们减小基线卷积编码器的频率池化尺寸,以获得融合频率、时间与通道信息的三维张量。因此,我们可利用通道嵌入实现谱注意力,而基线方法在RNN与MHSA层仅处理时序上下文,无法做到这一点。我们证明,所提分离式谱-时注意力显著提升了STARSS23开发集真实测试数据的声音事件检测与定位分数。此外,我们表明多种数据增强(如帧移、时间掩蔽、通道交换与适度mix-up)以及外部数据的使用,均有助于SELF(声音事件定位与检测)性能的整体提升。
引用
@article{arxiv.2306.02591,
title = {Divided spectro-temporal attention for sound event localization and detection in real scenes for DCASE2023 challenge},
author = {Yusun Shul and Byeong-Yun Ko and Jung-Woo Choi},
journal= {arXiv preprint arXiv:2306.02591},
year = {2023}
}