中文

CaTok:控制均值流用于一维因果图像标记化

计算机视觉与模式识别 2026-03-09 v1

摘要

自回归 (AR) 语言模型依赖因果标记化,但将这一范式扩展到视觉领域仍颇具挑战。当前的视觉标记器要么将 2D 补丁展平为非因果序列,要么强制执行启发式排序,与"下一个标记预测"模式不符。最近的扩散自编码器同样不足:解码器对所有标记的条件会丢失因果性,应用嵌套 dropout 机制又引入不平衡。为此,我们提出 CaTok,一种带有 MeanFlow 解码器的一维因果图像标记器。通过在时间间隔内选择标记并将其绑定到 MeanFlow 目标,CaTok 学习了支持快速单步生成和高保真多步采样的因果一维表示,同时自然地捕获跨标记间隔的多样化视觉概念。为进一步稳定和加速训练,我们提出了一种简单的正则化 REPA-A,将编码器特征与视觉基础模型 (VFM) 对齐。实验表明,CaTok 在 ImageNet 重建任务中实现了最先进的性能,FID 为 0.75,PSNR 为 22.53,SSIM 为 0.674,且所需训练周期更少,AR 模型的性能也与领先方法相当。

关键词

引用

@article{arxiv.2603.06449,
  title  = {CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization},
  author = {Yitong Chen and Zuxuan Wu and Xipeng Qiu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2603.06449},
  year   = {2026}
}

备注

Project website is available in https://sharelab-sii.github.io/catok-web