中文

uaMix-MAE:使用无监督音频混合高效微调预训练音频 Transformer

声音 2024-03-15 v1 机器学习 音频与语音处理

摘要

Masked Autoencoders (MAEs) 从无标签数据中学习丰富的低层表示,但需要大量有标签数据才能有效适应下游任务。相反,Instance Discrimination (ID) 强调高层语义,为缓解 MAEs 中的标注需求提供了潜在解决方案。尽管结合这两种方法可以解决具有有限有标签数据的下游任务,但将 ID 简单地集成到 MAEs 中会导致训练时间延长和高计算成本。为了应对这一挑战,我们引入了 uaMix-MAE,这是一种利用无监督音频混合的高效 ID 微调策略。利用对比微调,uaMix-MAE 对齐了预训练 MAEs 的表示,从而促进对特定任务语义的有效适应。为了用少量无标签数据优化模型,我们提出了一种音频混合技术,在输入和虚拟标签空间中操作音频样本。在低样本/少样本设置下的实验表明,当使用有限的无标签数据(如 AudioSet-20K)进行微调时,\modelname 在各种基准上实现了 4-6% 的准确率提升。代码可在 https://github.com/PLAN-Lab/uamix-MAE 获取

关键词

引用

@article{arxiv.2403.09579,
  title  = {uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures},
  author = {Afrina Tabassum and Dung Tran and Trung Dang and Ismini Lourentzou and Kazuhito Koishida},
  journal= {arXiv preprint arXiv:2403.09579},
  year   = {2024}
}

备注

5 pages, 6 figures, 4 tables. To appear in ICASSP'2024