中文

FlexTok:将图像重采样为灵活长度的 1D Token 序列

计算机视觉与模式识别 2025-06-05 v2 机器学习

摘要

图像分词通过提供比原始像素处理效率更高的压缩离散表示,推动了自回归图像生成的重大进展。虽然传统方法使用 2D 网格分词,但最近的方法(如 TiTok)表明,1D 分词可以通过消除网格冗余来实现高生成质量。然而,这些方法通常使用固定数量的 token,因此无法适应图像固有的复杂性。我们引入了 FlexTok,一种将 2D 图像投影为可变长度、有序 1D token 序列的分词器。例如,一张 256x256 的图像可以被重采样为 1 到 256 个离散 token,对其信息进行分层和语义压缩。通过训练整流流模型作为解码器并使用嵌套 dropout,FlexTok 无论选择的 token 序列长度如何,都能产生合理的重建。我们在自回归生成设置中使用简单的 GPT 风格 Transformer 评估了我们的方法。在 ImageNet 上,该方法在 8 到 128 个 token 上实现了 FID<2,优于 TiTok,并以更少的 token 匹配了最先进的方法。我们进一步扩展了模型以支持文本条件图像生成,并研究了 FlexTok 与传统 2D 分词的关系。一个关键发现是,FlexTok 使下一 token 预测能够以从粗到细的“视觉词汇”描述图像,并且要生成的 token 数量取决于生成任务的复杂性。

关键词

引用

@article{arxiv.2502.13967,
  title  = {FlexTok: Resampling Images into 1D Token Sequences of Flexible Length},
  author = {Roman Bachmann and Jesse Allardice and David Mizrahi and Enrico Fini and Oğuzhan Fatih Kar and Elmira Amirloo and Alaaeldin El-Nouby and Amir Zamir and Afshin Dehghan},
  journal= {arXiv preprint arXiv:2502.13967},
  year   = {2025}
}

备注

ICML 2025. Project page at https://flextok.epfl.ch/