探索 LLM 用于自动音乐情感标注的可行性
声音
2025-08-19 v1
摘要
当前音乐情感标注方法仍严重依赖手动标注,这一过程施加了显著的资源和劳动负担,严重限制了可用标注数据的规模。本研究考察了采用大语言模型(GPT-4o)进行音乐情感标注的可行性和可靠性。在本研究中,我们使用 GPT-4o 对古典钢琴 MIDI 音乐数据集 GiantMIDI-Piano 进行四象限 valence-arousal 框架下的标注,并与来自三位人类专家的标注进行比较。我们进行了广泛的评估,以衡量 GPT 生成的音乐情感标注的性能和可靠性,包括标准准确率、加权准确率(考虑专家间一致性)、标注者间一致性指标以及生成标签的分布相似性。尽管 GPT 的标注性能在整体准确率方面不及人类专家,并在细化特定情感状态的分类上表现较弱,但标注者可靠性指标表明,GPT 的变异性仍在人类专家间自然不一致的范围内。这些发现凸显了 GPT 基于标注的局限性和潜力:尽管其在人类表现方面存在当前不足,但其成本效益和效率使其成为音乐情感标注的有前景的可扩展替代方案。
引用
@article{arxiv.2508.12626,
title = {Exploring the Feasibility of LLMs for Automated Music Emotion Annotation},
author = {Meng Yang and Jon McCormack and Maria Teresa Llano and Wanchao Su},
journal= {arXiv preprint arXiv:2508.12626},
year = {2025}
}
备注
Accepted to be published at ISMIR 2025