将音乐建模为时频图像:一种用于音乐生成的二维分词器
声音
2026-05-18 v1 人工智能
摘要
自回归音乐生成高度依赖于音频分词器。现有的高保真编解码器通常使用残差多码本量化,这虽然保留了重建质量,但在序列展平后使语言建模变得复杂,因为残差层级结构施加了强序列依赖,并可能放大误差累积。我们提出了BandTok,一种面向生成的二维梅尔频谱图分词器,它使用来自单个共享码本的梅尔频带词元来表示每一帧。这种设计产生了一个物理上可解释的时频词元网格,具有更独立的词元结构,使其更适合自回归建模。BandTok通过多尺度PatchGAN目标和EMA码本更新来改进重建。我们进一步引入了一个带有二维旋转位置嵌入(2D RoPE)的自回归语言模型,以在生成过程中保留时间和频带结构。实验表明,BandTok优于残差码本分词器,并在数据有限的情况下取得了优异的结果。本工作的源代码和生成演示已公开。
引用
@article{arxiv.2605.15831,
title = {Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation},
author = {Yuqing Cheng and Xingyu Ma and Guochen Yu and Xiaotao Gu},
journal= {arXiv preprint arXiv:2605.15831},
year = {2026}
}