LLaQo:迈向基于查询的富有表现力音乐表演评估教练
音频与语音处理
2024-09-17 v2 多媒体
摘要
音乐理解的研究通过先进的表示形式广泛探索了作曲层面的属性,如调性、流派和配器,从而产生了使用大型语言模型的跨模态应用。然而,音乐表演的方面,如风格表达和技巧,仍未得到充分探索,以及使用大型语言模型通过定制反馈来增强教育成果的潜力。为了弥合这一差距,我们引入了LLaQo,一个基于大型语言查询的音乐教练,它利用音频语言建模来提供详细和形成性的音乐表演评估。我们还引入了指令调优的查询-响应数据集,涵盖了从音高准确性到发音的各种表演维度,以及上下文表演理解(如难度和表演技巧)。利用AudioMAE编码器和Vicuna-7b LLM后端,我们的模型在预测教师表演评分以及识别乐曲难度和演奏技巧方面取得了最先进(SOTA)的结果。此外,在一项使用音频-文本匹配的用户研究中,LLaQo的文本响应被评为显著高于其他基线模型。因此,我们提出的模型可以为来自音频数据的与音乐表演相关的开放式问题提供信息丰富的答案。
引用
@article{arxiv.2409.08795,
title = {LLaQo: Towards a Query-Based Coach in Expressive Music Performance Assessment},
author = {Huan Zhang and Vincent Cheung and Hayato Nishioka and Simon Dixon and Shinichi Furuya},
journal= {arXiv preprint arXiv:2409.08795},
year = {2024}
}