预训练语言模型在音乐理解上的评估
机器学习
2024-09-19 v1 人工智能
信息检索
声音
音频与语音处理
摘要
音乐-文本多模态系统为音乐信息检索(MIR)应用(如音频到文本和文本到音频检索、基于文本的歌曲生成以及音乐字幕生成)提供了新方法。尽管已有关于其成功的报道,但针对大型语言模型(LLM)音乐知识的评估工作却鲜有涉及。在本文中,我们证明了 LLM 存在以下问题:1)提示敏感性,2)无法建模否定(例如“没有吉他的摇滚歌曲”),以及 3)对特定词汇存在的敏感性。我们将这些属性量化为基于三元组的准确率,以评估在分层本体中建模标签相对相似性的能力。我们利用 Audioset 本体生成由锚点、正(相关)标签和负(相关性较低)标签组成的三元组,用于流派和乐器子树。我们评估了六个通用 Transformer 模型的基于三元组的音乐知识。通过该方法获得的三元组需要进行过滤,因为某些三元组难以判断,因此对评估目的而言信息量相对较低。尽管报告的准确率相对较高,但所有六个模型中都存在明显的不一致性,这表明现成的 LLM 在使用前需要进行针对音乐的适应。
引用
@article{arxiv.2409.11449,
title = {Evaluation of pretrained language models on music understanding},
author = {Yannis Vasilakis and Rachel Bittner and Johan Pauwels},
journal= {arXiv preprint arXiv:2409.11449},
year = {2024}
}