中文

DG-SED:面向异构训练数据声事件检测的领域泛化

音频与语音处理 2025-08-27 v3

摘要

本工作探索了声事件检测(SED)的领域泛化(DG),提升了其对真实场景的适应性。我们的方法采用了一种名为 DG-SED 的带有领域泛化的均值教师框架,以整合异构训练数据,同时保持 SED 模型在各数据集上的性能。具体而言,我们首先将 mixstyle 应用于频率维度,以适应来自不同领域的 mel 频谱图。接着,我们使用自适应残差归一化方法,通过在频率维度上应用实例归一化来跨多个领域泛化特征。最后,我们使用声事件边界框方法进行后处理。我们在 DCASE 2024 挑战赛 Task 4 上评估了所提出的方法 DG-SED,在 DESED 数据集上测量 PSDS,并在 MAESTRO 数据集上测量宏平均 pAUC。结果表明,与基线相比,所提出的 DG-SED 方法提升了 PSDS 和宏平均 pAUC。代码将在适当时候发布。

关键词

引用

@article{arxiv.2407.03654,
  title  = {DG-SED: Domain Generalization for Sound Event Detection with Heterogeneous Training Data},
  author = {Yang Xiao and Han Yin and Jisheng Bai and Rohan Kumar Das},
  journal= {arXiv preprint arXiv:2407.03654},
  year   = {2025}
}

备注

Accepted by the APSIPA ASC 2025