MIGE:相互增强的基于多模态指令的图像生成与编辑
计算机视觉与模式识别
2025-07-29 v4
摘要
尽管基于扩散的图像生成取得了显著进展,主体驱动生成和基于指令的编辑仍然具有挑战性。现有方法通常将它们分开处理,受限于有限的高质量数据和较差的泛化能力。然而,这两项任务都需要捕获复杂的视觉变化,同时保持输入和输出之间的一致性。受此启发,我们提出了 MIGE,一个使用多模态指令标准化任务表示的统一框架。它首先将主体驱动生成视为在空白画布上的创作,将基于指令的编辑视为对现有图像的修改,建立共享的输入-输出公式,然后引入一种新颖的多模态编码器,将自由格式的多模态指令映射到统一的视觉-语言空间,通过特征融合机制集成视觉和语义特征。这种统一使得两项任务能够联合训练,提供了两个关键优势:(1)跨任务增强:通过利用共享的视觉和语义表示,联合训练提高了主体驱动生成和基于指令编辑中的指令依从性和视觉一致性。(2)泛化能力:在统一格式中学习促进了跨任务知识转移,使 MIGE 能够泛化到新的组合任务,包括基于指令的主体驱动编辑。实验表明,MIGE 在主体驱动生成和基于指令的编辑方面均表现出色,同时在基于指令的主体驱动编辑这一新任务中达到了 SOTA。代码和模型已在 https://github.com/Eureka-Maggie/MIGE 上公开。
引用
@article{arxiv.2502.21291,
title = {MIGE: Mutually Enhanced Multimodal Instruction-Based Image Generation and Editing},
author = {Xueyun Tian and Wei Li and Bingbing Xu and Yige Yuan and Yuanzhuo Wang and Huawei Shen},
journal= {arXiv preprint arXiv:2502.21291},
year = {2025}
}
备注
This paper have been accepted by ACM MM25