中文

MAT-SED:基于掩码重建预训练的掩码音频Transformer用于声音事件检测

声音 2024-08-20 v2 人工智能 音频与语音处理

摘要

利用大规模预训练Transformer编码器网络的声音事件检测(SED)方法在最近的DCASE挑战中显示出良好的性能。然而,这些方法仍依赖于基于RNN的上下文网络来建模时序依赖关系,主要是由于标注数据稀缺。本文提出一种基于掩码重建预训练的纯Transformer-based SED模型,称为MAT-SED。具体而言,首先设计一种带有相对位置编码的Transformer作为上下文网络,通过对所有可用目标数据以自监督方式进行掩码重建预训练。此外,还提出一种全局-局部特征融合策略以增强局部分辨能力。对MAT-SED在DCASE2023 task4的评估结果显示,性能超越了当前最先进的方法,分别实现了0.587/0.896的PSDS1/PSDS2。

关键词

引用

@article{arxiv.2408.08673,
  title  = {MAT-SED: A Masked Audio Transformer with Masked-Reconstruction Based Pre-training for Sound Event Detection},
  author = {Pengfei Cai and Yan Song and Kang Li and Haoyu Song and Ian McLoughlin},
  journal= {arXiv preprint arXiv:2408.08673},
  year   = {2024}
}

备注

Received by interspeech 2024