中文

一种用于符号音乐情感识别的新型多任务学习方法

声音 2022-01-19 v1 信息检索 机器学习 多媒体 音频与语音处理

摘要

符号音乐情感识别(SMER)旨在从 MIDI 与 MusicXML 等符号数据中预测音乐情感。以往工作主要关注通过(掩码)语言模型预训练学习更好的表示,却忽略了音乐的内在结构,而其对音乐情感表达极为重要。本文提出一种简单的 SMER 多任务框架,将情感识别任务与源自音乐内在结构的其他情感相关辅助任务相结合。结果表明,我们的多任务框架可适配不同模型。此外,辅助任务的标签易于获取,意味着我们的多任务方法除情感外无需人工标注标签。在两个公开数据集(EMOPIA 与 VGMIDI)上的实验显示,我们的方法在 SMER 任务上表现更优:具体而言,EMOPIA 数据集上准确率绝对提升 4.17 个百分点至 67.58,VGMIDI 数据集上绝对提升 1.97 个百分点至 55.85。消融实验也显示了本文所设计多任务方法的有效性。

关键词

引用

@article{arxiv.2201.05782,
  title  = {A Novel Multi-Task Learning Method for Symbolic Music Emotion Recognition},
  author = {Jibao Qiu and C. L. Philip Chen and Tong Zhang},
  journal= {arXiv preprint arXiv:2201.05782},
  year   = {2022}
}