中文

迈向跨维度与类别模型的统一音乐情感识别

声音 2025-04-14 v2 人工智能 音频与语音处理

摘要

音乐情感识别(MER)面临的最重大挑战之一在于,不同数据集的情感标签在情感表示上可能是异构的,包括类别标签(如快乐、悲伤)与维度标签(如效价-唤醒度)。本文提出了一个统一的多任务学习框架,该框架结合了这两种类型的标签,因此能够在多个数据集上进行训练。该框架使用了一种有效的输入表示,结合了音乐特征(即调性和和弦)与MERT嵌入。此外,采用知识蒸馏将单个数据集上训练的教师模型的知识迁移到学生模型,增强了其跨多任务泛化的能力。为验证所提出的框架,我们在多个数据集上进行了广泛的实验,包括MTG-Jamendo、DEAM、PMEmo和EmoMusic。实验结果表明,音乐特征的加入、多任务学习和知识蒸馏显著提升了性能。特别是,我们的模型优于最先进的模型,包括在MTG-Jamendo数据集上MediaEval 2021竞赛中表现最佳的模型。我们的工作通过允许在一个统一框架中结合类别和维度情感标签,从而实现了跨数据集训练,为MER做出了重要贡献。

关键词

引用

@article{arxiv.2502.03979,
  title  = {Towards Unified Music Emotion Recognition across Dimensional and Categorical Models},
  author = {Jaeyong Kang and Dorien Herremans},
  journal= {arXiv preprint arXiv:2502.03979},
  year   = {2025}
}