中文

通过伪标签和知识蒸馏提升自动和弦识别性能

声音 2026-03-31 v3 信息检索 机器学习 多媒体

摘要

自动和弦识别(ACR)受限于对齐和弦标签稀缺的问题,因为高质量的对齐标注获取成本高昂。与此同时,开放权重的预训练模型比其专有训练数据更易获得。本文提出了两个阶段的训练流程,利用预训练模型与无标签音频数据。该方法将训练解耦为两个阶段。在第一个阶段,我们将预训练的BTC模型作为教师模型,用于为超过1000小时多样化无标签音频生成伪标签,并仅使用这些伪标签训练学生模型。在第二个阶段,学生模型在可获得的真实标签持续训练。为防止第一个阶段所学表征的灾难性遗忘,我们应用选择性知识蒸馏(KD)作为正则化器。在实验中,使用两个模型(BTC、2E1D)作为学生。在阶段1仅使用伪标签的情况下,BTC学生模型实现了超过99%的教师性能,而2E1D模型在七个标准mir_eval指标上达到约97%。在两个学生阶段都进行单次训练后, resulting BTC学生模型在所有指标上均超过传统监督学习基线提升2.5%,并超过原始预训练教师模型提升1.1-3.2%。 resulting 2E1D学生模型在传统监督学习基线上平均提升2.67%,并几乎达到与教师相当的性能。两种情况都在稀有和弦质量方面显示出显著提升。

关键词

引用

@article{arxiv.2602.19778,
  title  = {Enhancing Automatic Chord Recognition via Pseudo-Labeling and Knowledge Distillation},
  author = {Nghia Phan and Rong Jin and Gang Liu and Xiao Dong},
  journal= {arXiv preprint arXiv:2602.19778},
  year   = {2026}
}

备注

8 pages, 6 figures, 3 tables