中文

基于噪声学生训练与谐波音级轮廓的半监督音乐情感识别

声音 2021-12-10 v2 机器学习 音频与语音处理

摘要

我们展示了 Mirable 向 2021 年音乐情感与主题挑战赛的提交。在这项工作中,我们旨在解决一个问题:我们能否在音乐情感识别上利用半监督学习技术?为此,我们尝试了噪声学生训练,该方法已在图像分类领域提升了模型性能。由于噪声学生方法需要强大的教师模型,我们进一步探究了包括(i)输入训练时长和(ii)互补音乐表示在内的因素,以进一步提升教师模型性能。对于(i),我们发现以短输入时长训练的模型在 PR-AUC 上表现更好,而以长输入时长训练的模型在 ROC-AUC 上表现更好。对于(ii),我们发现使用谐波音级轮廓(HPCP)持续改善了标注性能,这表明谐波表示对音乐情感标注有用。最后,我们发现噪声学生方法仅对长训练时长的情况改善了标注结果。此外,我们发现集成以不同训练时长训练的表示能显著提升标注结果,这为未来工作中探索在网络架构中融入多时间分辨率指明了可能方向。

关键词

引用

@article{arxiv.2112.00702,
  title  = {Semi-supervised music emotion recognition using noisy student training and harmonic pitch class profiles},
  author = {Hao Hao Tan},
  journal= {arXiv preprint arXiv:2112.00702},
  year   = {2021}
}

备注

MediaEval 2021 submission for Emotion and Themes in Music