中文

重新思考生成式图像预训练:从尺度化下一像素预测来看,我们离实现这一目标还有多远?

计算机视觉与模式识别 2026-05-19 v2 机器学习

摘要

本文探讨了自回归下一像素预测的尺度化特性,这是一种简单而自洽的、但在统一视觉模型中仍较少被探索的框架。我们从32×32分辨率的图像开始,使用IsoFlops配置剖析,训练了一系列Transformer模型,计算预算高达7e19次浮点运算,并评估了三个不同的目标指标:下一像素预测目标、ImageNet分类准确率以及以Fréchet距离衡量的基于生成的完成。在固定32×32分辨率下,图像分类和图像生成的最优尺度化策略会发生分歧,其中生成的最优配置需要数据规模的增长速度快于分类最优配置3至5倍。此外,随着图像分辨率的提升,最优尺度化策略表明,模型规模必须远快于数据规模的增长。令人惊讶的是,通过投影我们的发现,我们发现计算资源而非训练数据的数量是主要瓶颈。随着计算能力年均增长4至5倍,我们预测在未来5年内,像素级图像建模将变得可行。

关键词

引用

@article{arxiv.2511.08704,
  title  = {Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?},
  author = {Xinchen Yan and Chen Liang and Lijun Yu and Adams Wei Yu and Yifeng Lu and Quoc V. Le},
  journal= {arXiv preprint arXiv:2511.08704},
  year   = {2026}
}

备注

Accepted by ICML2026