通用音频表示的对比学习
声音
2020-10-22 v1 机器学习
音频与语音处理
摘要
我们引入 COLA,一种用于学习音频通用表示的自监督预训练方法。我们的方法基于对比学习:它学习一种表示,对从同一录音提取的音频段赋予高相似度,而对来自不同录音的段赋予较低相似度。我们基于计算机视觉与强化学习中对比学习的最新进展,设计了一个轻量、易实现的音频自监督模型。我们在大规模 Audioset 数据库上预训练嵌入,并将这些表示迁移到 9 个多样分类任务,包括语音、音乐、动物声音与声学场景。我们表明尽管简单,我们的方法显著优于先前自监督系统。我们进一步进行消融实验以识别关键设计选择,并发布一个用于预训练与微调 COLA 模型的库。
引用
@article{arxiv.2010.10915,
title = {Contrastive Learning of General-Purpose Audio Representations},
author = {Aaqib Saeed and David Grangier and Neil Zeghidour},
journal= {arXiv preprint arXiv:2010.10915},
year = {2020}
}