MacTok:面向图像生成的鲁棒连续分词器
计算机视觉与模式识别
2026-04-01 v1 人工智能
摘要
连续图像分词器可实现高效的视觉生成,基于变分框架的分词器可通过 KL 正则化学习平滑、结构化的潜在表示。然而,这往往会导致在使用较少 token 时出现后验崩溃,即编码器未能将有信息特征编码到压缩后的潜在空间中。为此,我们引入了 **MacTok**——一个 **M**asked **A**ugmenting 1D **C**ontinuous **Tok**enizer,利用图像遮蔽和表示对齐来防止崩溃,同时学习紧凑且稳健的表示。MacTok 应用了随机遮蔽以正则化潜在学习,并采用 DINO 引导的语义遮蔽以强调图像中具有信息量的区域,迫使模型从不完整的视觉证据中编码出稳健的语义。结合全局和局部表示对齐,MacTok 在高度压缩的 1D 潜在空间中保留了丰富的判别性信息,仅需 64 或 128 个 token。在 ImageNet 基准上,MacTok 在 256×256 上的 gFID 达到 1.44,在 512×512 上的 SiT-XL 基准上实现最先进的 1.52,同时将 token 使用量降低了最高可达 64 倍。这些结果表明,遮蔽与语义引导共同防止了后验崩溃,实现了高效、高保真度的分词。
引用
@article{arxiv.2603.29634,
title = {MacTok: Robust Continuous Tokenization for Image Generation},
author = {Hengyu Zeng and Xin Gao and Guanghao Li and Yuxiang Yan and Jiaoyang Ruan and Junpeng Ma and Haoyu Albert Wang and Jian Pu},
journal= {arXiv preprint arXiv:2603.29634},
year = {2026}
}