中文

流向众数:寻求众数的扩散自编码器实现 State-of-the-Art 图像 Tokenization

计算机视觉与模式识别 2025-12-04 v3

摘要

自 VQGAN 和 latent diffusion 模型等流行视觉生成框架问世以来,state-of-the-art 的图像生成系统通常采用两阶段系统:首先将视觉数据 tokenize 或压缩到低维 latent 空间中,然后学习生成模型。Tokenizer 训练通常遵循标准流程,即在 MSE、感知损失与对抗损失的组合约束下对图像进行压缩与重建。先前工作已提出扩散自编码器作为学习端到端面向感知的图像压缩的一种方式,但在 ImageNet-1K 重建这一竞争性任务上尚未展现出 state-of-the-art 的性能。我们提出 FlowMo,一种基于 transformer 的扩散自编码器,在不使用卷积、对抗损失、空间对齐的二维 latent 码或从其他 tokenizer 蒸馏的情况下,在多种压缩率下实现了图像 tokenization 的新的 state-of-the-art。我们的核心洞察是,FlowMo 训练应分为 mode-matching 预训练阶段与 mode-seeking 后训练阶段。此外,我们进行了广泛分析,并探索了在 FlowMo tokenizer 之上训练生成模型。我们的代码与模型将发布于 http://kylesargent.github.io/flowmo 。

关键词

引用

@article{arxiv.2503.11056,
  title  = {Flow to the Mode: Mode-Seeking Diffusion Autoencoders for State-of-the-Art Image Tokenization},
  author = {Kyle Sargent and Kyle Hsu and Justin Johnson and Li Fei-Fei and Jiajun Wu},
  journal= {arXiv preprint arXiv:2503.11056},
  year   = {2025}
}

备注

ICCV 2025, 19 pages