中文

MTDA-HSED:基于互助调谐和双分支聚合的异构声音事件检测

声音 2024-09-12 v2 机器学习 音频与语音处理

摘要

声音事件检测 (SED) 在理解和感知声学场景中发挥着关键作用。先前的方法已显示出惊人的能力。然而,它们在从异构数据集中学习复杂场景特征方面不足。本文引入一种名为 Mutual-Assistance Tuning and Dual-Branch Aggregating for Heterogeneous Sound Event Detection (MTDA-HSED) 的新型双分支架构。MTDA-HSED 架构采用 Mutual-Assistance Audio Adapter (M3A) 来有效解决多场景问题,并使用 Dual-Branch Mid-Fusion (DBMF) 模块来解决多粒度问题。具体而言,M3A 被集成到 BEATs 块中作为一个适配器,通过在多场景数据集上进行微调来提高 BEATs 的性能。DBMF 模块连接 BEATs 和 CNN 分支,从而促进 BEATs 和 CNN 分支之间信息的深度融合。实验结果表明,所提出的方法在 DESED 和 MAESTRO Real 数据集上相对于基线的 mpAUC 提高了 \textbf{5%5\%}。代码可在 https://github.com/Visitor-W/MTDA 获取。

关键词

引用

@article{arxiv.2409.06196,
  title  = {MTDA-HSED: Mutual-Assistance Tuning and Dual-Branch Aggregating for Heterogeneous Sound Event Detection},
  author = {Zehao Wang and Haobo Yue and Zhicheng Zhang and Da Mu and Jin Tang and Jianqin Yin},
  journal= {arXiv preprint arXiv:2409.06196},
  year   = {2024}
}

备注

Submit to Icassp2025