OmniGen:统一图像生成模型
计算机视觉与模式识别
2024-11-22 v2 人工智能
摘要
大语言模型(LLMs)的出现统一了语言生成任务,并彻底改变了人机交互。然而,在图像生成领域,能够在单一框架内处理各种任务的统一模型在很大程度上仍未被探索。在这项工作中,我们提出了 OmniGen,一种用于统一图像生成的新型扩散模型。OmniGen 具有以下特点:1) 统一性:OmniGen 不仅展示了文本到图像的生成能力,还固有地支持各种下游任务,例如图像编辑、主题驱动生成和视觉条件生成。2) 简洁性:OmniGen 的架构高度简化,无需额外的插件。此外,与现有扩散模型相比,它更加用户友好,可以通过指令端到端地完成复杂任务,无需额外的中间步骤,极大地简化了图像生成工作流程。3) 知识迁移:得益于统一格式的学习,OmniGen 能在不同任务间有效迁移知识,处理未见过的任务和领域,并展现出新颖的能力。我们还探索了模型的推理能力和思维链机制的潜在应用。这项工作代表了通用图像生成模型的首次尝试,我们将在 https://github.com/VectorSpaceLab/OmniGen 发布相关资源,以促进未来的发展。
引用
@article{arxiv.2409.11340,
title = {OmniGen: Unified Image Generation},
author = {Shitao Xiao and Yueze Wang and Junjie Zhou and Huaying Yuan and Xingrun Xing and Ruiran Yan and Chaofan Li and Shuting Wang and Tiejun Huang and Zheng Liu},
journal= {arXiv preprint arXiv:2409.11340},
year = {2024}
}
备注
Update the paper for OmniGen-v1