BLIP3o-NEXT:原生图像生成的下一个前沿
计算机视觉与模式识别
2025-10-20 v1
摘要
我们提出 BLIP3o-NEXT,这是一个完全开源的 BLIP3 系列基础模型,推进了原生图像生成的下一个前沿。BLIP3o-NEXT 统一了文本到图像生成和图像编辑于单一架构中,展示出强大的图像生成和图像编辑能力。在开发领先的原生图像生成模型时,我们识别出四个关键见解:(1) 大多数架构选择产生相当的性能;只要架构能够高效扩展并支持快速推理,就可以认为其有效;(2) 成功应用强化学习可以进一步推动原生图像生成的前沿;(3) 图像编辑仍然是一个具有挑战性的任务,但通过后训练和数据引擎,可显著增强遵循指令性和生成图像与参考图像之间的一致性;(4) 数据质量和规模继续是决定模型性能上限的决定性因素。基于这些见解,BLIP3o-NEXT 利用 Autoregressive + Diffusion 架构,其中自回归模型首先生成以多模态输入为条件的离散图像标记,其隐藏状态 then 作为扩散模型的条件信号,用于生成高保真图像。该架构整合了自回归模型的推理能力和指令遵循性与扩散模型的细节渲染能力,实现了新的水平的连贯性和真实性。对 various text-to-image 和 image-editing 基准的广泛评估显示,BLIP3o-NEXT 在现有模型之上实现了卓越的性能。
引用
@article{arxiv.2510.15857,
title = {BLIP3o-NEXT: Next Frontier of Native Image Generation},
author = {Jiuhai Chen and Le Xue and Zhiyang Xu and Xichen Pan and Shusheng Yang and Can Qin and An Yan and Honglu Zhou and Zeyuan Chen and Lifu Huang and Tianyi Zhou and Junnan Li and Silvio Savarese and Caiming Xiong and Ran Xu},
journal= {arXiv preprint arXiv:2510.15857},
year = {2025}
}