中文

基于预训练音频嵌入的迁移学习与偏差校正

音频与语音处理 2023-07-21 v1 声音

摘要

深度神经网络模型已成为音乐信息检索(MIR)中大量任务的主导方法。这些模型通常需要大量(带标注的)训练数据以实现高准确率。由于并非所有 MIR 应用都有充足的训练数据,跨领域迁移模型正变得日益普遍。该方法可将为一任务导出的表示应用于另一任务,并能在下游任务训练数据要求较宽松的情况下实现高准确率。然而,预训练音频嵌入的特性尚未被充分理解。具体而言,与传统的手工设计特征不同,从预训练深度网络提取的表示可能嵌入并传播来自模型训练机制的偏差。本工作以乐器识别任务为背景,研究预训练音频表示中的偏差传播现象。我们首先证明三种不同的预训练表示(VGGish、OpenL3 和 YAMNet)在限定于单一数据集时表现相当,但在跨数据集(OpenMIC 和 IRMAS)泛化能力上存在差异。接着我们考察数据集身份与流派分布作为潜在的偏差来源。最后,我们提出并评估了用于减轻偏差影响、改善跨数据集泛化的后处理对策。

关键词

引用

@article{arxiv.2307.10834,
  title  = {Transfer Learning and Bias Correction with Pre-trained Audio Embeddings},
  author = {Changhong Wang and Gaël Richard and Brian McFee},
  journal= {arXiv preprint arXiv:2307.10834},
  year   = {2023}
}

备注

7 pages, 3 figures, accepted to the conference of the International Society for Music Information Retrieval (ISMIR 2023)