中文

探索 GPT 作为音乐理解中的裁判能力

信息检索 2025-01-24 v1 声音 音频与语音处理

摘要

近期基于文本的大型语言模型 (LLM) 的进展及其处理多模态感官数据扩展能力,使我们探索其在解决音乐信息检索 (MIR) 挑战方面的应用性。在本文中,我们采用系统化的提示工程方法解决 MIR 问题。将音乐数据转换为符号输入,评估 LLM 在检测注释错误方面的能力,针对三个关键 MIR 任务:节拍跟踪、和弦提取和调性估计。提出一种概念增强方法,用于评估 LLM 基于提供的音乐概念进行的音乐推理一致性。我们的实验测试了生成式预训练变换器 (GPT) 的 MIR 能力。结果显示,GPT 在节拍跟踪、和弦提取和调性估计任务中的错误检测准确率分别为 65.20%、64.80% 和 59.72%,均超过随机基线。此外,我们观察到 GPT 的错误查找准确率与提供概念信息量之间呈正相关。基于符号音乐输入的当前发现为未来的 LLM-based MIR 研究奠定了坚实的基础。

关键词

引用

@article{arxiv.2501.13261,
  title  = {Exploring GPT's Ability as a Judge in Music Understanding},
  author = {Kun Fang and Ziyu Wang and Gus Xia and Ichiro Fujinaga},
  journal= {arXiv preprint arXiv:2501.13261},
  year   = {2025}
}