EvoTok:基于残差潜在演化的统一图像标记器用于视觉理解与生成
计算机视觉与模式识别
2026-03-13 v1
摘要
统一多模态大语言模型 (MLLM) 的发展,面临视觉理解与生成之间的粒度差距:理解需要高层语义抽象,而图像生成则需要细粒度像素级表示。现有方法通常在相同的表示集上强制两种监督,或在分离的特征空间中解耦这些监督,导致干扰和不一致性。本文提出了 EvoTok,一种通过共享潜在空间内的残差演化过程来协调这些要求的统一图像标记器。与维持像素和语义分别标记空间不同,EvoTok 通过残差向量量化将图像编码为残差标记的级联序列。该残差序列形成演化轨迹,其中较早的阶段捕获低级细节,较深的阶段逐渐过渡到高层语义表示。尽管在仅1300万张图像的相对适中的数据集上训练,远少于许多前统一标记器使用的十亿规模数据集,EvoTok 在256x256分辨率下实现了0.43的强重建质量 (rFID)。当集成到大型语言模型时,EvoTok 在7个视觉理解基准测试中表现出色,并在图像生成基准测试(如 GenEval 和 GenAI-Bench)上取得显著结果。这些结果表明,将视觉表示建模为演化轨迹为统一视觉理解和生成提供了有效且原则的方法。
引用
@article{arxiv.2603.12108,
title = {EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation},
author = {Yan Li and Ning Liao and Xiangyu Zhao and Shaofeng Zhang and Xiaoxing Wang and Yifan Yang and Junchi Yan and Xue Yang},
journal= {arXiv preprint arXiv:2603.12108},
year = {2026}
}