中文

声事件检测中的时序注意力池化频率动态卷积

音频与语音处理 2025-04-18 v1 声音

摘要

近期深度学习技术,特别是频率动态卷积(FDY conv),显著提高了声事件检测(SED)通过实现频率自适应特征提取。然而,FDY conv依赖于时序平均池化,使其无法捕捉如警报铃、门敲门和语音塞音等瞬态声事件。为解决这一限制,我们提出时序注意力池化频率动态卷积(TFD conv)以取代时序平均池化。时序注意力池化(TAP)通过三个互补机制对时序特征进行自适应加权:时间注意力池化(TA)用于强调显著特征,速度注意力池化(VA)用于捕捉瞬态变化,传统平均池化用于对静止信号的鲁棒性。消融研究表明,TFD conv仅增加14.8%的参数,即可将平均PSDS1提高3.02%。类别wise ANOVA 和 Tukey HSD 分析进一步表明,TFD conv显著提升了对瞬态事件的检测性能,超越了现有的FDY conv模型。值得注意的是,TFD conv实现了最高的PSDS1得分0.456,超越了以往的最先进SED系统。我们还探讨了TAP与其他FDY conv变体的兼容性,包括膨胀FDY conv(DFD conv)、部分FDY conv(PFD conv)和多膨胀FDY conv(MDFD conv)。其中,TAP与MDFD conv的集成实现了最佳结果,PSDS1得分为0.459,验证了时序注意力与多尺度频率适应性的互补优势。这些发现确立了TFD conv作为增强时序灵敏度和整体特征鲁棒性在SED中强大且可推广的框架。

关键词

引用

@article{arxiv.2504.12670,
  title  = {Temporal Attention Pooling for Frequency Dynamic Convolution in Sound Event Detection},
  author = {Hyeonuk Nam and Yong-Hwa Park},
  journal= {arXiv preprint arXiv:2504.12670},
  year   = {2025}
}