中文

MuCPT:音乐相关自然语言模型继续预训练

计算与语言 2025-11-19 v1

摘要

大型语言模型在通用任务上表现优异,但在专业场景(尤其是音乐-娱乐领域)仍受限,其中语料规模、纯度以及数据与训练目标的匹配度是关键。我们通过构建大型音乐相关自然语言语料库(400亿标记),结合开源与内部数据,来解决此问题,并实施领域优先数据管道:轻量级分类器筛选与加权领域内文本,随后进行多阶段清洗、去重与隐私保留掩码。我们进一步将多源音乐文本与关联元数据集成,形成更广泛、结构更好的领域知识基础。在训练方面,我们引入基于参考模型(RM)的标记级软评分进行质量控制:统一的损失比准则同时用于数据选择和动态加权 During优化过程中,减少噪声梯度并放大任务对齐信号,从而更有效地实现音乐领域的继续预训练与对齐。为评估事实性,我们设计MusicSimpleQA基准,采用短于单一答案提示并进行自动一致性评分。除基准设计外,我们沿数据组成轴展开系统比较。总体而言,本工作在语料与目标两方面均取得进展,为构建音乐领域领域LLM提供可扩展的数据-训练框架,并提供可重用的评估工具。

关键词

引用

@article{arxiv.2511.14245,
  title  = {MuCPT: Music-related Natural Language Model Continued Pretraining},
  author = {Kai Tian and Yirong Mao and Wendong Bi and Hanjie Wang and Que Wenhui},
  journal= {arXiv preprint arXiv:2511.14245},
  year   = {2025}
}