DECAR:用于学习通用音频表示的深度聚类
声音
2023-03-15 v4 计算与语言
音频与语音处理
摘要
我们引入了 DECAR,一种用于学习通用音频表示的自监督预训练方法。我们的系统基于聚类:它利用离线聚类步骤提供目标标签,作为解决预测任务的伪标签。我们在计算机视觉自监督学习的最新进展基础上进行开发,并设计了一种轻量、易用的自监督预训练方案。我们在大规模 Audioset 数据集的平衡子集上预训练 DECAR 嵌入,并将这些表示迁移到 9 个下游分类任务中,包括语音、音乐、动物声音和声学场景。此外,我们进行了消融研究以确定关键设计选择,并公开了所有代码和预训练模型。
引用
@article{arxiv.2110.08895,
title = {DECAR: Deep Clustering for learning general-purpose Audio Representations},
author = {Sreyan Ghosh and Sandesh V Katta and Ashish Seth and S. Umesh},
journal= {arXiv preprint arXiv:2110.08895},
year = {2023}
}