中文

基于原型的掩码音频模型用于声音事件检测的自监督学习

声音 2024-09-27 v1 人工智能 音频与语音处理

摘要

声音事件检测 (SED) 中的一个重要挑战是有效地利用无标签数据,因为由于高标注成本,标注数据的可用性有限。半监督算法依赖标注数据从无标签数据中学习,其性能受限于前者的质量和规模。本文提出一种用于 SED 的自监督表征学习的 Prototype based Masked Audio Model (PMAM) 算法,以更好地利用无标签数据。具体而言,基于高斯混合模型 (GMM) 构建的原型分布模型用于构造语义丰富的帧级伪标签。这些伪标签监督基于 Transformer 的掩码音频模型的学习,采用二进制交叉熵损失代替广泛使用的 InfoNCE 损失,以来自不同原型的独立损失贡献,这在场景中很重要,因为多个标签可能适用于无监督数据帧。最终通过仅使用少量标注数据进行微调,可获得性能极佳的 SED 模型。在使用 DESED 任务的等效测试中,我们的方法实现了 62.5% 的 PSDS1 分数,超越当前最先进的模型,显示所提出技术的优越性。

关键词

引用

@article{arxiv.2409.17656,
  title  = {Prototype based Masked Audio Model for Self-Supervised Learning of Sound Event Detection},
  author = {Pengfei Cai and Yan Song and Nan Jiang and Qing Gu and Ian McLoughlin},
  journal= {arXiv preprint arXiv:2409.17656},
  year   = {2024}
}

备注

Submitted to ICASSP2025; The code for this paper will be available at https://github.com/cai525/Transformer4SED after the paper is accepted