SmartEdit:利用多模态大语言模型探索复杂指令驱动的图像编辑
计算机视觉与模式识别
2023-12-13 v1
摘要
当前基于指令的编辑方法,如 InstructPix2Pix,由于依赖扩散模型中简单的 CLIP 文本编码器,在复杂场景下往往无法产生令人满意的结果。为了纠正这一点,本文引入了 SmartEdit,这是一种新颖的基于指令的图像编辑方法,利用多模态大语言模型 (MLLM) 来增强其理解和推理能力。然而,这些元素的直接集成在需要复杂推理的情况下仍然面临挑战。为了缓解这个问题,我们提出了一个双向交互模块,该模块能够在输入图像和 MLLM 输出之间实现全面的双向信息交互。在训练过程中,我们首先引入感知数据以提升扩散模型的感知和理解能力。随后,我们证明少量复杂的指令编辑数据可以有效激发 SmartEdit 针对更复杂指令的编辑能力。我们进一步构建了一个新的评估数据集 Reason-Edit,专门为复杂的基于指令的图像编辑量身定制。在该评估数据集上的定量和定性结果均表明,我们的 SmartEdit 超越了先前的方法,为复杂指令驱动的图像编辑的实际应用铺平了道路。
引用
@article{arxiv.2312.06739,
title = {SmartEdit: Exploring Complex Instruction-based Image Editing with Multimodal Large Language Models},
author = {Yuzhou Huang and Liangbin Xie and Xintao Wang and Ziyang Yuan and Xiaodong Cun and Yixiao Ge and Jiantao Zhou and Chao Dong and Rui Huang and Ruimao Zhang and Ying Shan},
journal= {arXiv preprint arXiv:2312.06739},
year = {2023}
}
备注
Project page: https://yuzhou914.github.io/SmartEdit/