w2v-SELD:面向自监督空间音频预训练的声事件定位与检测框架
音频与语音处理
2024-01-02 v2 声音
摘要
声事件检测与定位(SELD)是一项复杂任务,依赖于带有标注声事件及其各自位置的大量多声道音频记录。在本文中,我们引入了一种自监督SELD方法,该方法改编自wav2vec 2.0的预训练方法,直接从原始音频数据中学习表示,无需监督。通过将这种方法应用于SELD,我们可以利用大量未标注的3D音频数据来学习声事件及其位置的鲁棒表示。我们的方法包括两个主要阶段:预训练和微调。在预训练阶段,利用未标注的3D音频数据集训练我们的w2v-SELD模型,捕获音频信号中固有的复杂高层特征和上下文信息。随后,在微调阶段,使用带有标注SELD数据的较小数据集对预训练模型进行微调。在基准数据集上的实验结果表明,所提出的自监督SELD方法有效。该模型超越了数据集提供的基线系统,并达到了与最先进监督方法相媲美的竞争性能。我们的w2v-SELD模型的代码和预训练参数可在该仓库中获取。
引用
@article{arxiv.2312.06907,
title = {w2v-SELD: A Sound Event Localization and Detection Framework for Self-Supervised Spatial Audio Pre-Training},
author = {Orlem Lima dos Santos and Karen Rosero and Roberto de Alencar Lotufo},
journal= {arXiv preprint arXiv:2312.06907},
year = {2024}
}
备注
17 pages, 5 figures