中文

DreamOmni:统一的图像生成与编辑

计算机视觉与模式识别 2025-10-03 v2

摘要

当前,大型语言模型(LLM)的成功表明,统一的多任务方法可以显著提升模型可用性,简化部署,并在不同任务之间促进协同效应。然而,在计算机视觉领域,尽管文本到图像(T2I)模型通过规模化取得了显著的生成质量提升,但其框架设计最初并未考虑如何与下游任务(如各种类型的编辑)集成。为此,我们引入 DreamOmni,这是一个用于图像生成和编辑的统一模型。我们首先分析现有框架和下游任务的需求,提出一种将 T2I 模型和各种编辑任务集成的统一框架。此外,另一个关键挑战是高质量编辑数据的有效创建,特别是针对基于指令的编辑和拖拽式编辑。为此,我们开发了一个使用类似贴纸的元素来合成准确、高质量数据集的合成数据管道,这使得编辑数据能够规模化,以支持统一模型训练。对于训练,DreamOmni 同时训练 T2I 生成和下游任务。T2I 训练有助于模型理解特定概念并提高生成质量,而编辑训练有助于模型把握编辑任务的细微差别。这种协作显著提升了编辑性能。广泛的实验确认了 DreamOmni 的有效性。该代码和模型将对外发布。

关键词

引用

@article{arxiv.2412.17098,
  title  = {DreamOmni: Unified Image Generation and Editing},
  author = {Bin Xia and Yuechen Zhang and Jingyao Li and Chengyao Wang and Yitong Wang and Xinglong Wu and Bei Yu and Jiaya Jia},
  journal= {arXiv preprint arXiv:2412.17098},
  year   = {2025}
}