中文

DuoTok:面向多轨音乐语言模型的源感知双轨分词

声音 2026-04-02 v2 人工智能

摘要

音频分词将连续波形与多轨音乐语言模型建立起联系。在双轨建模中,标记应同时保留三个属性:高保真重建、在语言模型下的强可预测性,以及跨轨对应关系。我们引入 DuoTok,一种源感知的双轨分词器,通过分阶段解�合来解决这一权衡。DuoTok 首先预训练语义编码器,然后通过多任务监督进行正则化,冻结编码器后应用硬性双码书路由,同时保持对量化代码的辅助目标。扩散解码器重建高频细节,使标记能够专注于为序列建模处理结构化信息。在标准基准测试上,DuoTok 实现了可取的可预测性与保真度之间的权衡,在保持 0.75 kbps 竞争的重建质量的同时,达到了最低的 cnBPT。在恒定双轨语言模型建模协议下,enBPT 也得到改善,表明超出码本大小效应的收益。受控诊断显示,在跨轨损坏情况下可预测性代价更大,而在更长上下文中则获得更大收益,表明使用 DuoTok 生成的标记训练的模型利用了跨轨结构和非局部历史。

关键词

引用

@article{arxiv.2511.20224,
  title  = {DuoTok: Source-Aware Dual-Track Tokenization for Multi-Track Music Language Modeling},
  author = {Rui Lin and Zhiyue Wu and Jiahe Le and Kangdi Wang and Weixiong Chen and Junyu Dai and Tao Jiang},
  journal= {arXiv preprint arXiv:2511.20224},
  year   = {2026}
}

备注

17 pages, 5 figures, 8 tables. Project page: https://eps-acoustic-revolution-lab.github.io/DUO_TOK/