中文

Selftok:基于自回归、扩散与推理的离散视觉令牌

计算机视觉与模式识别 2025-05-28 v3

摘要

我们彻底抛弃了图像表示中传统的空间先验,引入一种新型离散视觉词典器:自洽词典器(Selftok)。其设计核心在于通过图像生成的逆扩散过程,将自回归(AR)先验——类似于语言中的因果结构——嵌入视觉令牌中。AR 属性使 Selftok 在以下两个关键方面与传统空间令牌根本不同:- Selftok 提供了一种优雅且简约的方法,将扩散与 AR 统一用于视觉-语言模型(VLM):通过使用 Selftok 令牌表示图像,我们可以仅使用纯离散自回归架构(如 LLM 所用的架构)来训练 VLM,而无需额外的模块或训练目标。- 我们理论上证明,AR 先验满足贝尔曼方程,而空间先验不满足。这意味着,Selftok 支持以相当于 LLM 所实现效果的效果进行视觉生成的强化学习。除了 AR 属性之外,Selftok 还是一种 SOTA 词典器,在高质量重构和压缩率之间取得了理想的平衡。我们使用 Selftok 构建了一个纯 AR VLM,用于视觉理解和生成任务。令人印象深刻的是,尽管未使用任何文本-图像训练对,一个简单的策略梯度 RL 在视觉令牌中运行即可显著提升视觉生成基准,超越所有现有模型。因此,我们相信 Selftok 有效解决了视觉令牌无法支持有效强化学习的长期挑战。当结合 LLM 中 RL 的既有优势时,这为实现真正的多模态 LLM 迈出了一步重要的一步。项目页面:https://selftok-team.github.io/report/。

关键词

引用

@article{arxiv.2505.07538,
  title  = {Selftok: Discrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning},
  author = {Bohan Wang and Zhongqi Yue and Fengda Zhang and Shuo Chen and Li'an Bi and Junzhe Zhang and Xue Song and Kennard Yanting Chan and Jiachun Pan and Weijia Wu and Mingze Zhou and Wang Lin and Kaihang Pan and Saining Zhang and Liyu Jia and Wentao Hu and Wei Zhao and Hanwang Zhang},
  journal= {arXiv preprint arXiv:2505.07538},
  year   = {2025}
}