中文

自监督卷积音频模型是灵活的声学特征学习器:域特异性与迁移学习研究

音频与语音处理 2025-02-05 v1

摘要

自监督学习(SSL)算法已成为强大的工具,可利用大量无标签音频数据进行预训练,以获得支持多种下游任务强性能的鲁棒表示。目前,这些方法大多针对语音和非语音应用分别开发。本文探讨了卷积模型预训练数据相对于不同下游语音和非语音任务的域特异性,使用自监督预训练方法(BYOL-A)。我们发现,无论预训练是在语音数据、非语音数据或两者组合上,所得预训练模型都能在几乎所有下游任务上实现良好性能,甚至超过或相当于流行的领域特定模型。只有在不同预训练数据集之间观察到较小的域特异性优势。作为基准的流行领域特定模型在其目标域表现良好,但在其他域通常表现不佳。综合这些结果,表明SSL方法是一种强大的学习灵活表示的方法,可用于无标签的特定领域数据。当下游数据相似或可能存在领域不匹配时,这些模型可作为后续迁移学习、微调或数据探索应用的强大资源。

关键词

引用

@article{arxiv.2502.02366,
  title  = {Self-Supervised Convolutional Audio Models are Flexible Acoustic Feature Learners: A Domain Specificity and Transfer-Learning Study},
  author = {Mattson Ogg},
  journal= {arXiv preprint arXiv:2502.02366},
  year   = {2025}
}