中文

桥接连续与离散标记:自回归视觉生成

计算机视觉与模式识别 2025-09-01 v3

摘要

自回归视觉生成模型通常依赖标记化器将图像压缩为可顺序预测的标记。标记表示存在根本性困境:离散标记可轻松通过标准交叉熵损失建模,但会产生信息损失和标记器训练不稳定;连续标记能更好保留视觉细节,但需要复杂的分布建模,使生成管道更为复杂。本文提出 TokenBridge,通过保持连续标记的强大表示能力,同时保留离散标记的建模简便性。为实现这一目标,我们通过后训练量化将离散化从标记器训练过程中解耦,直接从连续表示获取离散标记。具体方法引入维度级量化策略,独立离散化每个特征维度,搭配轻量级自回归预测机制,高效建模 resulting large token space。广泛实验表明,我们的方法在保持标准分类预测的同时,实现与连续方法相当的重建和生成质量。本工作表明,桥接离散与连续范式可有效发挥两者优势,为简单自回归建模下的高质量视觉生成提供了可行路径。项目页面:https://yuqingwang1029.github.io/TokenBridge。

关键词

引用

@article{arxiv.2503.16430,
  title  = {Bridging Continuous and Discrete Tokens for Autoregressive Visual Generation},
  author = {Yuqing Wang and Zhijie Lin and Yao Teng and Yuanzhi Zhu and Shuhuai Ren and Jiashi Feng and Xihui Liu},
  journal= {arXiv preprint arXiv:2503.16430},
  year   = {2025}
}

备注

Accepted by ICCV 2025. Project page: https://yuqingwang1029.github.io/TokenBridge