半监督自学习增强的音乐情感识别
声音
2025-04-23 v3 人工智能
音频与语音处理
摘要
音乐情感识别(MER)旨在识别给定音乐作品传达的情感。然而,在 MER 领域,可获得的公共数据集样本大小有限。最近提出了基于段落的方法用于情感相关任务,这些方法在较短的段落上训练骨干网络,而不是整个音频剪辑,从而自然地在不需额外资源的情况下扩充训练样本。然后,对预测的段落级结果进行聚合,以获得整个歌曲的预测。最常用的方法是该段继承包含其中的剪辑的标签,但音乐情感在整个剪辑期间并非恒定。这会引入标签噪声并使训练容易过拟合。为处理噪声标签问题,本文提出了一种半监督自学习(SSSL)方法,该方法可以自学习方式区分正确标签和错误标签的样本,从而有效地利用扩充后的段落级数据。在三个公共情感数据集上的实验表明,所提出的方法能够实现更好或相当的性能。
引用
@article{arxiv.2410.21897,
title = {Semi-Supervised Self-Learning Enhanced Music Emotion Recognition},
author = {Yifu Sun and Xulong Zhang and Monan Zhou and Wei Li},
journal= {arXiv preprint arXiv:2410.21897},
year = {2025}
}
备注
12 pages, 2 figures