图像生成器是通才视觉学习器
计算机视觉与模式识别
2026-05-15 v2 人工智能
摘要
近期研究表明,图像和视频生成器展现出零样本视觉理解行为,这让人联想到大语言模型(LLMs)如何从生成式预训练中发展出语言理解和推理的涌现能力。尽管长期以来人们推测创造视觉内容的能力意味着理解它的能力,但关于生成式视觉模型已发展出强大理解能力的证据一直有限。在这项工作中,我们证明了图像生成训练扮演着类似于 LLM 预训练的角色,并使模型学习到强大且通用的视觉表示,从而在各种视觉任务上实现 SOTA 性能。我们引入了 Vision Banana,这是一个通才模型,通过在 Nano Banana Pro (NBP) 的原始训练数据与少量视觉任务数据的混合集上进行指令微调而构建。通过将视觉任务的输出空间参数化为 RGB 图像,我们无缝地将感知重构为图像生成。我们的通才模型 Vision Banana 在涉及 2D 和 3D 理解的各种视觉任务上取得了 SOTA 结果,击败或比肩零样本领域专家,包括在分割任务上的 Segment Anything Model 3,以及在度量深度估计上的 Depth Anything 系列。我们表明,这些结果可以通过轻量级指令微调实现,而不会牺牲基础模型的图像生成能力。这些卓越的结果表明,图像生成预训练是一种通才视觉学习器。它还表明,图像生成可以作为视觉任务的统一且通用的接口,类似于文本生成在语言理解和推理中的作用。我们可能正在见证计算机视觉的一个重大范式转变,其中生成式视觉预训练在构建用于生成和理解的视觉基础模型中占据核心地位。
引用
@article{arxiv.2604.20329,
title = {Image Generators are Generalist Vision Learners},
author = {Valentin Gabeur and Shangbang Long and Songyou Peng and Paul Voigtlaender and Shuyang Sun and Yanan Bao and Karen Truong and Zhicheng Wang and Wenlei Zhou and Jonathan T. Barron and Kyle Genova and Nithish Kannen and Sherry Ben and Yandong Li and Mandy Guo and Suhas Yogin and Yiming Gu and Huizhong Chen and Oliver Wang and Saining Xie and Howard Zhou and Kaiming He and Thomas Funkhouser and Jean-Baptiste Alayrac and Radu Soricut},
journal= {arXiv preprint arXiv:2604.20329},
year = {2026}
}
备注
Project Page: http://vision-banana.github.io