中文

SongSage:具备抒情生成预训练的大型音乐语言模型

计算与语言 2026-01-06 v1

摘要

大型语言模型在各个领域已取得显著进展,但其对抒情导向知识的理解尚未得到充分探索。本文首先引入PlaylistSense数据集,用于评估语言模型的播放列表理解能力。PlaylistSense涵盖十种用户查询类型,源自常见的实际场景,挑战LLMs准确把握播放列表特征并解决多样化用户意图。全面评估表明,当前通用型LLMs在播放列表理解方面仍有提升空间。灵感来自这一发现,我们引入SongSage,这是一个具备多样化抒情智能的大型音乐语言模型,通过抒情生成预训练实现上述能力。SongSage在聚焦抒情内容的548亿token规模的LyricBank语料上进行持续预训练,随后在涵盖九大核心抒情任务的77.5万样本构成的LyricBank-SFT指令集上进行微调。实验结果表明,SongSage展现出强大的抒情知识理解能力,在零样歌单推荐中优异地重写用户查询,能够有效生成和延续抒情内容,并在七项其他能力上表现出色。除抒情专长外,SongSage仍保留通用知识理解能力,取得具竞争力的MMLU分数。由于版权原因,我们将保持数据集不可访问,仅发布SongSage及其训练脚本以确保可重复性,推动音乐AI研究与应用发展,数据集发布计划详述于附录。

关键词

引用

@article{arxiv.2601.01153,
  title  = {SongSage: A Large Musical Language Model with Lyric Generative Pre-training},
  author = {Jiani Guo and Jiajia Li and Jie Wu and Zuchao Li and Yujiu Yang and Ping Wang},
  journal= {arXiv preprint arXiv:2601.01153},
  year   = {2026}
}