中文

半监督自学习增强的音乐情感识别

声音 2025-04-23 v3 人工智能 音频与语音处理

摘要

音乐情感识别(MER)旨在识别给定音乐作品传达的情感。然而,在 MER 领域,可获得的公共数据集样本大小有限。最近提出了基于段落的方法用于情感相关任务,这些方法在较短的段落上训练骨干网络,而不是整个音频剪辑,从而自然地在不需额外资源的情况下扩充训练样本。然后,对预测的段落级结果进行聚合,以获得整个歌曲的预测。最常用的方法是该段继承包含其中的剪辑的标签,但音乐情感在整个剪辑期间并非恒定。这会引入标签噪声并使训练容易过拟合。为处理噪声标签问题,本文提出了一种半监督自学习(SSSL)方法,该方法可以自学习方式区分正确标签和错误标签的样本,从而有效地利用扩充后的段落级数据。在三个公共情感数据集上的实验表明,所提出的方法能够实现更好或相当的性能。

关键词

引用

@article{arxiv.2410.21897,
  title  = {Semi-Supervised Self-Learning Enhanced Music Emotion Recognition},
  author = {Yifu Sun and Xulong Zhang and Monan Zhou and Wei Li},
  journal= {arXiv preprint arXiv:2410.21897},
  year   = {2025}
}

备注

12 pages, 2 figures