中文

通过多稀疏频率动态卷积突破声事件检测的极限

音频与语音处理 2024-09-23 v3 声音

摘要

频率动态卷积 (FDY conv) 已是声事件检测 (SED) 领域的里程碑,但其因多个基准核的引入导致模型规模显著增加。本文提出部分频率动态卷积 (PFD conv),其通过常规 2D 卷积和 FDY conv 的输出在静态分支和动态分支分别进行拼接。PFD-CRNN 采用动态分支输出比例为 1/8,较 FDY-CRNN 减少 51.9% 的参数,同时保持性能。此外,本文提出多稀疏频率动态卷积 (MDFD conv),其在单个卷积层中集成多个不同稀疏率的频率动态卷积 (DFD conv) 分支及静态分支。最终构建的最佳 MDFD-CRNN 包含五个非稀疏 FDY 卷积分支、三个不同稀疏率的 DFD 卷积分支以及一个静态分支,相较于未使用类别-wise 中位数滤波器的 FDY conv 在多音调声检测得分 (PSDS) 上提升 3.17%。将声事件边界框作为后处理应用于最佳 MDFD-CRNN,其获得的真实 PSDS1 为 0.485,为 DESED 数据集上无外部数据集或预训练模型的最高 SOTA 分数。通过大量消融实验,我们发现不仅多个动态分支,而且特定比例的静态分支对声事件检测也至关重要。此外,除非稀疏动态分支外,仅靠稀疏动态分支无法获得最佳 SED 性能。进一步的消融研究结果不仅深化了对 FDY conv 变体的理解,也提升了其实际可用性。

关键词

引用

@article{arxiv.2406.13312,
  title  = {Pushing the Limit of Sound Event Detection with Multi-Dilated Frequency Dynamic Convolution},
  author = {Hyeonuk Nam and Yong-Hwa Park},
  journal= {arXiv preprint arXiv:2406.13312},
  year   = {2024}
}

备注

Submitted to ICASSP 2025