中文

OpenUni:统一多模态理解与生成的简单基线

计算机视觉与模式识别 2025-06-03 v3

摘要

在本报告中,我们提出了 OpenUni,一个用于统一多模态理解与生成的简单、轻量且完全开源的基线。受统一模型学习中通行实践的启发,我们采用了一种高效的训练策略,通过一组可学习的查询和一个轻量级的基于 Transformer 的连接器,将现成的多模态大语言模型(LLM)与扩散模型桥接起来,从而最小化训练复杂度与开销。凭借极简的架构选择,我们证明了 OpenUni 能够:1) 生成高质量且与指令对齐的图像,以及 2) 在 GenEval、DPG-Bench 和 WISE 等标准基准上,仅使用 1.1B 和 3.1B 激活参数便取得卓越的性能。为了支持开放研究和社区发展,我们在 https://github.com/wusize/OpenUni 发布了所有模型权重、训练代码以及我们精心整理的训练数据集(包含 23M 图像-文本对)。

关键词

引用

@article{arxiv.2505.23661,
  title  = {OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation},
  author = {Size Wu and Zhonghua Wu and Zerui Gong and Qingyi Tao and Sheng Jin and Qinyue Li and Wei Li and Chen Change Loy},
  journal= {arXiv preprint arXiv:2505.23661},
  year   = {2025}
}