VibeToken:用于动态分辨率生成的1D图像标记器和自回归模型的扩展
计算机视觉与模式识别
2026-04-29 v1 机器学习
摘要
我们提出了一种高效、分辨率无关的自回归(AR)图像合成方法,可推广到任意分辨率和宽高比,缩小与扩散模型在规模上的差距。其核心是VibeToken,一种新颖的分辨率无关的基于Transformer的1D图像标记器,将图像编码为动态、用户可控制的32至256标记序列,在效率和性能之间实现最佳平衡。基于VibeToken,我们提出了VibeToken-Gen,一种类别条件的AR生成器,原生支持任意分辨率,且计算资源显著减少。值得注意的是,VibeToken-Gen仅使用64个标记即可合成1024x1024图像,实现3.94 gFID;与此相比,基于扩散的state-of-the-art替代方案需要1,024个标记,仅达到5.87 gFID。与固定分辨率AR模型如LlamaGen(在1024x1024时为11T FLOPs)相比,VibeToken-Gen保持恒定的179G FLOPs(63.4倍效率),与分辨率无关。我们希望VibeToken能帮助推动AR视觉生成模型在生产用例中的广泛采用。
关键词
引用
@article{arxiv.2604.24885,
title = {VibeToken: Scaling 1D Image Tokenizers and Autoregressive Models for Dynamic Resolution Generations},
author = {Maitreya Patel and Jingtao Li and Weiming Zhuang and Yezhou Yang and Lingjuan Lv},
journal= {arXiv preprint arXiv:2604.24885},
year = {2026}
}
备注
Accepted at CVPR'26 | Project Page: https://github.com/SonyResearch/VibeToken