中文

大规模自监督学习在零样本音频分类中的可转移性

声音 2024-02-15 v3 机器学习 音频与语音处理

摘要

在近年来,自监督学习凭借其从无标签数据中学习稳健特征表示的能力而取得了巨大成功。通过自监督预训练的网络作为有效的特征提取器,可用于下游任务,包括零样本学习。虽然在图像领域已广泛评估无监督方法用于零样本学习的方法,但在声学领域却明显缺失。本研究填补了这一空白,评估了大规模自监督模型在零样本音频分类中的性能。此外,我们探讨了模型零样本学习能力与其他下游任务基准之间的关系。我们的发现表明,在某些零样本问题(如 SpeechCommandsv2)中实现了最佳性能,并且在基于语音的零样本问题与各种下游音频任务之间存在强烈相关性。

关键词

引用

@article{arxiv.2402.01274,
  title  = {On the Transferability of Large-Scale Self-Supervision to Few-Shot Audio Classification},
  author = {Calum Heggan and Sam Budgett and Timothy Hospedales and Mehrdad Yaghoobi},
  journal= {arXiv preprint arXiv:2402.01274},
  year   = {2024}
}

备注

Camera Ready version as submitted to ICASSP SASB Workshop 2024. 5 pages, 2 figures, 3 tables