ViTok-v2:将本征分辨率自编码器扩展至 50 亿参数
计算机视觉与模式识别
2026-05-08 v1 人工智能
机器学习
摘要
Vision Transformer(ViT)自编码器已成为图像令牌化器的有力选择,重建质量优于卷积令牌化器。然而现有 ViT 令牌化器无法充分探索这一landscape,因为性能在训练分辨率之外会下降,且依赖对抗损失阻碍稳定扩展。ViTok(Hansen-Estruch 等,2025)发现压缩比 r 在重建-生成之间调和 trade-off 中发挥关键作用:r 越小重建越好但生成越困难,因此提升令牌化器的重建质量是实现更具Pareto最优性的令牌化器的关键。我们提出 ViTok-v2,通过 NaFlex 实现原生分辨率支持,实现对不同分辨率和宽高比的普适化;同时引入新型 DINOv3 感知损失,取代 LPIPS 和 GAN 目标,实现任意规模下的稳定训练。ViTok-v2 在约 20 亿张图像上训练并扩展至 50 亿参数,目前规模最大的图像自编码器。ViTok-v2 在 256p 上匹配或超越当前最佳重建,在 512p 及以上分辨率下均优于所有基线。在与 flow matching 生成器的联合扩展实验中,我们展示自编码器与生成器的同步扩展可推进该 trade-off 的Pareto 前沿。
引用
@article{arxiv.2605.05331,
title = {ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters},
author = {Philippe Hansen-Estruch and Jiahui Chen and Vivek Ramanujan and Orr Zohar and Yan Ping and Animesh Sinha and Markos Georgopoulos and Edgar Schoenfeld and Ji Hou and Felix Juefei-Xu and Sriram Vishwanath and Ali Thabet},
journal= {arXiv preprint arXiv:2605.05331},
year = {2026}
}