中文

Ovis-U1 技术报告

计算机视觉与模式识别 2025-07-02 v2 人工智能

摘要

本报告介绍了 Ovis-U1,这是一个集成多模态理解、文本到图像生成和图像编辑能力的 30 亿参数统一模型。基于 Ovis 系列的基础之上,Ovis-U1 采用基于扩散的视觉解码器配合双向 token 细化器,实现了与 GPT-4o 等领先模型相当的图像生成任务性能。与某些先前模型使用冻结 MLLM 进行生成任务不同,Ovis-U1 采用一种新的统一训练方法,从语言模型开始训练。与仅在理解或生成任务上训练相比,统一训练能获得更好的性能,体现了将这两项任务集成所带来的提升。Ovis-U1 在 OpenCompass 多模态学术基准测试中取得 69.6 分的分数,超越了 Ristretto-3B 和 SAIL-VL-1.5-2B 等近期领先模型。在文本到图像生成方面,它在 DPG-Bench 和 GenEval 测试基准上分别取得了 83.72 和 0.89 的分数。对于图像编辑,它在 ImgEdit-Bench 和 GEdit-Bench-EN 上分别取得了 4.00 和 6.42 分。作为 Ovis 统一模型系列的初始版本,Ovis-U1 推动了多模态理解、生成和编辑的边界。

关键词

引用

@article{arxiv.2506.23044,
  title  = {Ovis-U1 Technical Report},
  author = {Guo-Hua Wang and Shanshan Zhao and Xinjie Zhang and Liangfu Cao and Pengxin Zhan and Lunhao Duan and Shiyin Lu and Minghao Fu and Xiaohao Chen and Jianshan Zhao and Yang Li and Qing-Guo Chen},
  journal= {arXiv preprint arXiv:2506.23044},
  year   = {2025}
}

备注

An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1