重新思考生成式图像预训练:从尺度化下一像素预测来看,我们离实现这一目标还有多远?
计算机视觉与模式识别
2026-05-19 v2 机器学习
摘要
本文探讨了自回归下一像素预测的尺度化特性,这是一种简单而自洽的、但在统一视觉模型中仍较少被探索的框架。我们从32×32分辨率的图像开始,使用IsoFlops配置剖析,训练了一系列Transformer模型,计算预算高达7e19次浮点运算,并评估了三个不同的目标指标:下一像素预测目标、ImageNet分类准确率以及以Fréchet距离衡量的基于生成的完成。在固定32×32分辨率下,图像分类和图像生成的最优尺度化策略会发生分歧,其中生成的最优配置需要数据规模的增长速度快于分类最优配置3至5倍。此外,随着图像分辨率的提升,最优尺度化策略表明,模型规模必须远快于数据规模的增长。令人惊讶的是,通过投影我们的发现,我们发现计算资源而非训练数据的数量是主要瓶颈。随着计算能力年均增长4至5倍,我们预测在未来5年内,像素级图像建模将变得可行。
引用
@article{arxiv.2511.08704,
title = {Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?},
author = {Xinchen Yan and Chen Liang and Lijun Yu and Adams Wei Yu and Yifeng Lu and Quoc V. Le},
journal= {arXiv preprint arXiv:2511.08704},
year = {2026}
}
备注
Accepted by ICML2026