中文

Khala:规模化声学标记语言模型以实现高保真音乐生成

声音 2026-05-05 v1 人工智能

摘要

高质量音乐生成的常见设计模式是分别在不同表示空间中处理结构与保真度:生成器首先建模高层次结构,随后通过基于扩散或神经解码的阶段重构细节。在本工作中,我们探索了另一种观点:两者可在单一深层声学标记层级中逐步建模。为此,我们构建了 64 层残差向量量化(RVQ)声学表示,并提出了两阶段从粗到细的生成框架。主干模型首先为整首曲目生成粗糙声学标记,超分辨率模型随后在相同的声学标记空间中完成更细粒度的标记。超分辨率阶段以全曲目尺度进行工作,逐层细化标记,同时在时间维度上并行运行,实现固定的 62 步推理过程。为进一步提升歌词对齐和细节重构,我们引入混合注意力训练:对齐目标采用因果注意力,而层级细化使用全局注意力。我们的一个关键发现是,文本-人声对齐可在纯粹的声学标记语言建模中自然出现,无需单独的语义标记阶段。此外,从训练好的主干模型初始化超分辨率模型显著提高了收敛速度和最终质量。综上所述,我们的结果表明,高质量音乐生成可在无需将结构与保真度分离到异构表示空间的前提下,通过统一的声学标记层级中逐步建模来实现。

关键词

引用

@article{arxiv.2605.01790,
  title  = {Khala: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation},
  author = {Jiafeng Liu and Yuanliang Dong and Hongjia Liu and Yuqing Cheng and Zhancheng Guo and Huijing Liang and Wenbo Zhan and Yuming Sun and Xiaobing Li and Feng Yu and Maosong Sun},
  journal= {arXiv preprint arXiv:2605.01790},
  year   = {2026}
}