探索空间声音事件表征的自监督对比学习
音频与语音处理
2023-09-29 v1 机器学习
声音
摘要
在本研究中,我们提出了一个用于对比学习的简单多通道框架(MC-SimCLR),以编码空间音频的“什么”与“哪里”。MC-SimCLR 从未标注的空间音频中学习联合频谱与空间表征,从而增强下游任务中的事件分类与声源定位。其核心在于,我们提出了一种多层级数据增强流水线,对波形、梅尔频谱图和广义互相关(GCC)特征等不同层级的音频特征进行增强。此外,我们引入了简单而有效的通道级增强方法,随机交换麦克风顺序并掩蔽梅尔与 GCC 通道。利用这些增强,我们发现学习表征之上的线性层在事件分类准确率与定位误差方面均显著优于有监督模型。我们还全面分析了各增强方法的效果,并比较了使用不同数量标注数据的微调性能。
引用
@article{arxiv.2309.15938,
title = {Exploring Self-Supervised Contrastive Learning of Spatial Sound Event Representation},
author = {Xilin Jiang and Cong Han and Yinghao Aaron Li and Nima Mesgarani},
journal= {arXiv preprint arXiv:2309.15938},
year = {2023}
}