SLICER:利用低资源自监督预训练学习通用音频表示
音频与语音处理
2023-05-19 v2 人工智能
计算与语言
声音
摘要
我们提出一种新的自监督学习(SSL)方法,在未标记音频数据上预训练编码器,从而降低音频与语音分类对大量标记数据的需求。我们的首要目标是学习能在低资源未标记音频预训练设定下泛化至大量语音与非语音任务的音频表示。受近期基于SSL的语音表示学习中聚类与对比学习范式成功的启发,我们提出SLICER(实例与簇级高效表示的对称学习),其汇聚了聚类与对比学习范式二者之长。我们使用学生与教师编码器潜在表示间的对称损失,并同时求解实例与簇级对比学习任务。我们通过将输入谱图投影至维度等于簇数的输出子空间,在线获得簇表示。此外,我们提出一种基于mixup的新颖梅尔谱图增强过程k-mix,其不需要标签并助力音频的无监督表示学习。总体而言,SLICER在LAPE基准\cite{9868132}上取得最先进结果,显著优于DeLoRes-M及其他先前方法,后者在 更大量的无监督数据上预训练。我们将在GitHub上公开所有代码。
引用
@article{arxiv.2211.01519,
title = {SLICER: Learning universal audio representations using low-resource self-supervised pre-training},
author = {Ashish Seth and Sreyan Ghosh and S. Umesh and Dinesh Manocha},
journal= {arXiv preprint arXiv:2211.01519},
year = {2023}
}
备注
ICASSP 2023