用于自监督音频预训练的掩码频谱图预测
声音
2022-04-28 v1 音频与语音处理
摘要
基于Transformer的模型在充足数据上训练时能取得优异结果并具有良好的泛化能力。然而,受限于音频领域可用的有限数据,大多数用于音频任务的基于Transformer的模型都是从其他领域(例如图像)的预训练模型微调而来,这与音频领域存在显著差距。其他方法直接在音频领域探索自监督学习方法,但目前在下游任务中表现不佳。在本文中,我们提出了一种新颖的用于基于Transformer的音频模型的自监督学习方法,称为掩码频谱图预测(MaskSpec),以从无标签音频数据(本文使用AudioSet)中学习强大的音频表示。我们的方法掩蔽输入频谱图的随机块,并使用编码器-解码器架构重建被掩蔽的区域。在不使用额外模型权重或监督的情况下,在多个下游数据集上的实验结果表明,MaskSpec相比有监督方法取得了显著的性能提升,并优于以往的预训练模型。特别是,我们的最佳模型在AudioSet上达到0.471(mAP),在OpenMIC2018上达到0.854(mAP),在ESC-50上达到0.982(准确率),在SCV2上达到0.976(准确率),在DCASE2019 Task1A上达到0.823(准确率)。
引用
@article{arxiv.2204.12768,
title = {Masked Spectrogram Prediction For Self-Supervised Audio Pre-Training},
author = {Dading Chong and Helin Wang and Peilin Zhou and Qingcheng Zeng},
journal= {arXiv preprint arXiv:2204.12768},
year = {2022}
}
备注
Submit to INTERSPEECH 2022