中文

将音乐建模为时频图像:一种用于音乐生成的二维分词器

声音 2026-05-18 v1 人工智能

摘要

自回归音乐生成高度依赖于音频分词器。现有的高保真编解码器通常使用残差多码本量化,这虽然保留了重建质量,但在序列展平后使语言建模变得复杂,因为残差层级结构施加了强序列依赖,并可能放大误差累积。我们提出了BandTok,一种面向生成的二维梅尔频谱图分词器,它使用来自单个共享码本的梅尔频带词元来表示每一帧。这种设计产生了一个物理上可解释的时频词元网格,具有更独立的词元结构,使其更适合自回归建模。BandTok通过多尺度PatchGAN目标和EMA码本更新来改进重建。我们进一步引入了一个带有二维旋转位置嵌入(2D RoPE)的自回归语言模型,以在生成过程中保留时间和频带结构。实验表明,BandTok优于残差码本分词器,并在数据有限的情况下取得了优异的结果。本工作的源代码和生成演示已公开。

关键词

引用

@article{arxiv.2605.15831,
  title  = {Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation},
  author = {Yuqing Cheng and Xingyu Ma and Guochen Yu and Xiaotao Gu},
  journal= {arXiv preprint arXiv:2605.15831},
  year   = {2026}
}