InsightEdit:提升图像编辑指令跟随能力
计算机视觉与模式识别
2024-11-27 v1
摘要
本文聚焦于基于指令的数据驱动图像编辑任务。先前的工作如 InstructPix2Pix、InstructDiffusion 和 SmartEdit 探索了端到端的编辑方法,但仍存在两个局限:其一,现有数据集分辨率较低、背景一致性差、指令过于简单;其二,当前方法主要基于文本条件,而图像信息充分利用不足,导致在复杂指令跟随和保持背景一致性方面表现不佳。针对上述问题,我们首先构建了 InsightEdit 数据集,采用新颖的数据构建流程,形成高质量视觉、复杂指令和良好背景一致性的大规模数据集。随后,为了充分注入丰富的图像信息,我们引入双流桥接机制,利用强大的多模态大语言模型(MLLM)对文本和视觉特征进行推理,从而更精确地指导图像编辑过程。大量实验结果表明,我们提出的 InsightEdit 在复杂指令跟随和保持原图背景一致性方面实现了最先进的性能。
引用
@article{arxiv.2411.17323,
title = {InsightEdit: Towards Better Instruction Following for Image Editing},
author = {Yingjing Xu and Jie Kong and Jiazhi Wang and Xiao Pan and Bo Lin and Qiang Liu},
journal= {arXiv preprint arXiv:2411.17323},
year = {2024}
}