中文

HDA-SELD: 面向低资源视听声事件定位与检测的层级跨模态蒸馏与多层级数据增强

声音 2025-09-30 v2 多媒体

摘要

本工作提出了 HDA-SELD,一个统一框架,结合了层级跨模态蒸馏 (HCMD) 和多层级数据增强,以解决低资源视听 (AV) 声事件定位与检测 (SELD) 问题。一个纯音频 SELD 模型充当教师,通过输出响应和中间特征表示将知识迁移给视听学生模型。为增强学习,通过随机混合从多个网络层选取的特征以及为 SELD 任务定制的相关损失函数来应用数据增强。在 DCASE 2023 和 2024 挑战赛 SELD 数据集上的大量实验表明,所提方法显著提升了 AV SELD 性能,在整体指标上相对于基线取得了 21%-38% 的相对增益。值得注意的是,我们提出的 HDA-SELD 取得了与在更大数据集上训练的教师模型相当或更优的结果,在 DCASE 2023 和 2024 挑战赛 SELD 任务上均超越了最先进的方法。

关键词

引用

@article{arxiv.2508.12334,
  title  = {HDA-SELD: Hierarchical Cross-Modal Distillation with Multi-Level Data Augmentation for Low-Resource Audio-Visual Sound Event Localization and Detection},
  author = {Qing Wang and Ya Jiang and Hang Chen and Sabato Marco Siniscalchi and Jun Du and Jianqing Gao},
  journal= {arXiv preprint arXiv:2508.12334},
  year   = {2025}
}

备注

13 pages, 8 figures