OmniGen2:面向指令对齐的多模态生成
计算机视觉与模式识别
2026-04-22 v4 人工智能
计算与语言
摘要
在本工作中,我们介绍了 OmniGen2,一个 versatile 且开源的生成模型,旨在为包括文本到图像、图像编辑和 in-context 生成在内的多种生成任务提供统一解决方案。不同于 OmniGen v1,OmniGen2 具有两种用于文本和图像模态的 distinct 解码路径,利用 unshared 参数和解耦图像 tokenizer。这种设计使 OmniGen2 能够在不重新适配 VAE 输入的情况下建立在现有多模态理解模型之上,从而保留原始文本生成能力。为促进 OmniGen2 的训练,我们开发了完整的数据构建管线,涵盖图像编辑和 in-context 生成数据。此外,我们针对图像生成任务引入了一种反思机制,并基于 OmniGen2 精选了专门的反思数据集。尽管其相对适中的参数规模,OmniGen2 在多个任务基准测试中都取得了竞争成绩,包括文本到图像和图像编辑。为进一步评估 in-context 生成,也称为 subject-driven 任务,我们引入了一个新的基准名为 OmniContext。OmniGen2 在开源模型中实现了最先进的一致性水平。我们将发布我们的模型、训练代码、数据集和数据构建管线,以支持该领域的未来研究。项目页面:https://vectorspacelab.github.io/OmniGen2;GitHub 链接:https://github.com/VectorSpaceLab/OmniGen2
关键词
引用
@article{arxiv.2506.18871,
title = {OmniGen2: Towards Instruction-Aligned Multimodal Generation},
author = {Chenyuan Wu and Pengfei Zheng and Ruiran Yan and Shitao Xiao and Xin Luo and Yueze Wang and Wanli Li and Xiyan Jiang and Yexin Liu and Junjie Zhou and Ze Liu and Ziyi Xia and Chaofan Li and Haoge Deng and Jiahao Wang and Kun Luo and Bo Zhang and Defu Lian and Xinlong Wang and Zhongyuan Wang and Tiejun Huang and Zheng Liu},
journal= {arXiv preprint arXiv:2506.18871},
year = {2026}
}