BLIP3-o:一个全开源统一多模态模型-架构、训练与数据集
计算机视觉与模式识别
2025-05-15 v1 人工智能
摘要
统一图像理解和生成的研究近年来受到广泛关注。虽然图像理解的设计选择已被广泛研究,但针对统一框架(集成图像生成)的最佳模型架构和训练配方仍属未探索领域。受自回归模型和扩散模型在高质量生成和可扩展性方面潜力的驱动,我们系统研究了这些方法在统一多模态环境中的应用,重点关注图像表示、建模目标和训练策略。在这些调查基础上,我们提出了一种新方法,采用扩散变换器生成富含语义的CLIP图像特征,不同于传统基于VAE的表示。该设计实现了更高的训练效率和更好的生成质量。此外,我们演示了一种顺序预训练策略对于统一模型——先进行图像理解,再进行图像生成——具有实际优势,通过保留图像理解能力的同时发展出强大的图像生成能力。最后,我们精心策划了一个高质量的指令调优数据集BLIP3o-60k,用于图像生成,通过用各种描述性短语(涵盖各种场景、物体、人体姿态等)提示GPT-4o。基于我们创新的模型设计、训练配方和数据集,我们开发了BLIP3-o,一套最先进的统一多模态模型。BLIP3-o在大多数流行基准(涵盖图像理解和生成任务)上实现了卓越的性能。为促进未来研究,我们完全开源了我们的模型,包括代码、模型权重、训练脚本以及预训练和指令调优数据集。
引用
@article{arxiv.2505.09568,
title = {BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset},
author = {Jiuhai Chen and Zhiyang Xu and Xichen Pan and Yushi Hu and Can Qin and Tom Goldstein and Lifu Huang and Tianyi Zhou and Saining Xie and Silvio Savarese and Le Xue and Caiming Xiong and Ran Xu},
journal= {arXiv preprint arXiv:2505.09568},
year = {2025}
}