统一多模态预训练中的新兴属性
计算机视觉与模式识别
2025-07-29 v3
摘要
在前沿专有系统中,统一多模态理解和生成已展现出令人瞩目的能力。本文我们引入了 BAGEL,一个开源基础模型,原生支持多模态理解和生成。BAGEL 是一个统一的、仅使用解码器的模型,预训练于来自大规模交错文本、图像、视频和网页数据的数千亿标记。当以如此多样化的多模态交错数据进行规模化训练时,BAGEL 显示现了复杂多模态推理的新兴能力。因此,它在标准基准测试中的多模态生成和理解方面显著优于开源统一模型,同时展现了诸如自由形式图像操控、未来帧预测、3D 操控和世界导航等先进的多模态推理能力。希望通过本工作促进多模态研究的进一步机遇,我们分享了关键发现、预训练细节、数据创建协议,并向社区发布代码和模型检查点。项目页面位于 https://bagel-ai.org/。
引用
@article{arxiv.2505.14683,
title = {Emerging Properties in Unified Multimodal Pretraining},
author = {Chaorui Deng and Deyao Zhu and Kunchang Li and Chenhui Gou and Feng Li and Zeyu Wang and Shu Zhong and Weihao Yu and Xiaonan Nie and Ziang Song and Guang Shi and Haoqi Fan},
journal= {arXiv preprint arXiv:2505.14683},
year = {2025}
}
备注
37 pages, 17 figures