中文

UNFUSED:基于自监督蒸馏的无监督微调方法

音频与语音处理 2023-05-19 v2 人工智能

摘要

本文提出UnFuSeD,一种利用自监督学习并减少对大量标注数据需求以用于音频分类的新方法。与以往直接在目标数据集上微调自监督预训练编码器的研究不同,我们在实际微调步骤之前,使用编码器生成伪标签进行无监督微调。我们首先在未标注音频数据集上使用一种新颖的自监督学习算法(SSL)训练编码器,然后通过对提取的表示进行聚类,在目标任务数据集上使用该编码器生成伪标签。这些伪标签随后用于指导随机初始化模型上的自蒸馏,我们称之为无监督微调。最后,所得编码器在目标任务数据集上微调。通过UnFuSeD,我们提出了首个脱离文献中通用SSL范式(预训练与微调同一编码器)的系统,并给出了一种基于自蒸馏的新颖系统,以利用SSL预训练进行低资源音频分类。实践中,UnFuSeD在LAPE Benchmark上取得了最先进的结果,显著优于所有基线。此外,UnFuSeD使我们以比先前最先进系统少40%的参数实现了这一结果。我们公开了所有代码。

关键词

引用

@article{arxiv.2303.05668,
  title  = {UNFUSED: UNsupervised Finetuning Using SElf supervised Distillation},
  author = {Ashish Seth and Sreyan Ghosh and S. Umesh and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2303.05668},
  year   = {2023}
}

备注

ICASSP 2023 SASB Workshop