中文

让模型学会感受:模式引导的符号音乐情感识别中的调性注入

声音 2025-12-23 v1 人工智能 多媒体

摘要

音乐情感识别是符号音乐理解(SMER)中的关键任务。最近的研究表明,通过微调大规模预训练模型(如 MIDIBERT,这是符号音乐理解基准中的一个模型)将音乐语义映射到情感标签方面取得了有前景的成果。虽然这些模型有效地捕获了分布式音乐语义,但往往忽略调性结构,尤其是音乐模式,而根据音乐心理学,模式在情感感知中起着关键作用。在本文中,我们调查了 MIDIBERT 的表征能力,并识别出其在捕获模式-情感关联方面的局限性。为此,我们提出了一种模式引导增强(Mode-Guided Enhancement, MoGE)策略,将心理学见解纳入模型。具体而言,我们首先进行了模式增强分析,发现 MIDIBERT 未能有效编码情感-模式相关性。随后,我们识别出情感最不相关的那一层,引入一种模式引导特征线性调制注入(Mode-guided Feature-wise linear modulation injection, MoFi)框架,以注入显式的模式特征,从而增强模型在情感表征和推断方面的能力。在 EMOPIA 和 VGMIDI 数据集上的大量实验表明,模式注入策略显著提高了 SMER 性能,分别实现了 75.2% 和 59.1% 的准确率。这些结果验证了在符号音乐情感识别中采用模式引导建模的有效性。

关键词

引用

@article{arxiv.2512.17946,
  title  = {Let the Model Learn to Feel: Mode-Guided Tonality Injection for Symbolic Music Emotion Recognition},
  author = {Haiying Xia and Zhongyi Huang and Yumei Tan and Shuxiang Song},
  journal= {arXiv preprint arXiv:2512.17946},
  year   = {2025}
}

备注

Accepted by AAAI 2026