中文

用于声音事件检测的频率动态卷积

音频与语音处理 2025-06-17 v1 声音

摘要

基于深度学习的声事件检测(SND)研究近期主要聚焦于卷积循环神经网络(CRNN)和 Transformer 模型。然而,传统的基于二维卷积的模型假设在时间轴和频率轴上均具有平移不变性,导致在处理声学信号的频率相关特性时产生不一致。为解决这一问题,本研究提出了频率动态卷积(FDY conv),它根据输入信号的频率组成动态调整卷积核以增强声事件检测性能。FDY conv 通过自适应地加权多个基核的频率特定注意力权重来构建最优频率响应。实验结果表明,将 FDY conv 应用于 CRNN 可在 DESED 数据集上相比基线 CRNN 提升 7.56% 的性能。然而,FDY conv 存在局限性,即它在所有频率上组合相同形状的基核,限制了其捕捉多样频率特定特征的能力。此外,3×33\times3 的基核尺寸不足以捕捉更广泛的频率范围。为克服这些局限性,本研究引入了 FDY conv 的扩展族。膨胀 FDY conv(DFD conv)在频率轴上应用具有不同膨胀率的卷积核以扩大感受野并增强频率特定特征表示。实验结果表明,DFD conv 相比基线提升了 9.27%。部分 FDY conv(PFD conv)解决了 FDY conv 因对所有卷积操作使用动态核而导致的高计算复杂度问题。由于 FDY conv 可能对准稳态声事件引入不必要的自适应,PFD conv 将标准二维卷积与频率自适应核相结合,在保持性能的同时降低了计算复杂度。实验结果表明,PFD conv 相比基线提升了 7.80%,同时相比 FDY conv 将参数数量减少了 54.4%。多膨胀 FDY conv(MDFD conv)通过利用具有不同膨胀率的多个卷积核扩展了 DFD conv,有效捕捉了多样的频率依赖模式。实验结果表明,MDFD conv 取得了最高性能,相比基线 CRNN 提升了 10.98%。此外,标准 FDY conv 采用时间平均池化,对时间轴上的所有帧赋予等权重,限制了其有效捕捉瞬态事件的能力。为克服这一问题,本研究提出了 TAP-FDY conv(TFD conv),它集成了时间注意力池化(TA,聚焦显著特征)、速度注意力池化(VA,强调瞬态特性)和平均池化(AP,捕捉稳态特性)。TAP-FDY conv 取得了与 MDFD conv 相同的性能,但将参数数量减少了约 30.01%(12.703M vs. 18.157M),以较低的计算复杂度实现了等效精度。类别级性能分析表明,FDY conv 改善了对非稳态事件的检测,DFD conv 对具有宽频谱特征的事件尤为有效,PFD conv 增强了对准稳态事件的检测。此外,TFD conv(TFD-CRNN)在瞬态事件检测中表现出色。在案例研究中,PFD conv 有效捕捉了油箱动力系统故障识别中的稳定信号模式,DFD conv 识别了变速电机故障识别中的宽谐波频谱模式,而 TFD conv 在海上电弧检测的瞬态信号检测中优于其他模型。这些结果表明,频率自适应卷积及其扩展变体为传统二维卷积在基于深度学习的音频处理中提供了稳健的替代方案。

关键词

引用

@article{arxiv.2506.12785,
  title  = {Frequency Dynamic Convolutions for Sound Event Detection},
  author = {Hyeonuk Nam},
  journal= {arXiv preprint arXiv:2506.12785},
  year   = {2025}
}

备注

Ph. D. Dissertation in English(KAIST)