中文

以音乐元数据 LLM 为基础重新思考音乐标题生成

声音 2026-02-04 v1 机器学习

摘要

音乐标题生成,即生成音乐的自然语言描述的任务,对音乐理解和可控音乐生成都有用处。然而,训练标题生成模型通常需要高质量的音乐标题数据,而相对于元数据(例如,风格、情绪等)则稀缺。因此,常见做法是使用大型语言模型(LLM)从元数据合成标题来生成用于标题生成模型的训练数据,但这一过程会施加固定的风格化,并将事实信息与自然语言风格捆绑在一起。作为一种更直接的方法,我们提出基于元数据的标题生成。我们训练一个元数据预测模型,从音频中推断详细的音乐元数据,然后在推理时通过预训练的 LLM 将其转换为富有表现力的标题。相对于在 LLM 生成的标题上训练的强大的端到端基线,本方法:(1)在较少的训练时间内实现了与端到端标题生成器相当的性能;(2)提供了灵活性,以轻松更改风格化,使输出标题可以针对特定的风格和质量要求进行定制;(3)可以使用音频和部分元数据进行提示,以实现强大的元数据填充或填充——这是组织音乐数据的常见任务。

关键词

引用

@article{arxiv.2602.03023,
  title  = {Rethinking Music Captioning with Music Metadata LLMs},
  author = {Irmak Bukey and Zhepei Wang and Chris Donahue and Nicholas J. Bryan},
  journal= {arXiv preprint arXiv:2602.03023},
  year   = {2026}
}

备注

Accepted to ICASSP 2026