中文

VibeToken:用于动态分辨率生成的1D图像标记器和自回归模型的扩展

计算机视觉与模式识别 2026-04-29 v1 机器学习

摘要

我们提出了一种高效、分辨率无关的自回归(AR)图像合成方法,可推广到任意分辨率和宽高比,缩小与扩散模型在规模上的差距。其核心是VibeToken,一种新颖的分辨率无关的基于Transformer的1D图像标记器,将图像编码为动态、用户可控制的32至256标记序列,在效率和性能之间实现最佳平衡。基于VibeToken,我们提出了VibeToken-Gen,一种类别条件的AR生成器,原生支持任意分辨率,且计算资源显著减少。值得注意的是,VibeToken-Gen仅使用64个标记即可合成1024x1024图像,实现3.94 gFID;与此相比,基于扩散的state-of-the-art替代方案需要1,024个标记,仅达到5.87 gFID。与固定分辨率AR模型如LlamaGen(在1024x1024时为11T FLOPs)相比,VibeToken-Gen保持恒定的179G FLOPs(63.4倍效率),与分辨率无关。我们希望VibeToken能帮助推动AR视觉生成模型在生产用例中的广泛采用。

关键词

引用

@article{arxiv.2604.24885,
  title  = {VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations},
  author = {Maitreya Patel and Jingtao Li and Weiming Zhuang and Yezhou Yang and Lingjuan Lv},
  journal= {arXiv preprint arXiv:2604.24885},
  year   = {2026}
}

备注

Accepted at CVPR'26 | Project Page: https://github.com/SonyResearch/VibeToken