TIE:面向复杂提示遵循与高保真编辑的文本图像编辑革新
计算机视觉与模式识别
2024-05-28 v1
摘要
随着图像生成领域的快速发展,传统扩散模型以及结合多模态大型语言模型(LLMs)的扩散模型在解释复杂提示和保持编辑前后图像一致性方面仍存在局限性。为了应对这些挑战,我们提出了一种创新的图像编辑框架,利用多模态 LLM 强大的思维链推理和定位能力来辅助扩散模型生成更精细的图像。我们首先精心设计了一个包含指令分解、区域定位和详细描述的思维链过程。随后,我们使用多模态 LLM 的思维链过程和编辑图像的掩码对轻量级多模态 LLM LISA 模型进行微调。通过向扩散模型提供生成的提示和图像掩码知识,我们的模型生成对指令具有更优理解的图像。通过大量实验,我们的模型在图像生成方面展现出了卓越的性能,超越了现有的 SOTA 模型。值得注意的是,我们的模型表现出增强的理解复杂提示并生成相应图像的能力,同时在生成前后的图像中保持高保真度和一致性。
引用
@article{arxiv.2405.16803,
title = {TIE: Revolutionizing Text-based Image Editing for Complex-Prompt Following and High-Fidelity Editing},
author = {Xinyu Zhang and Mengxue Kang and Fei Wei and Shuang Xu and Yuhe Liu and Lin Ma},
journal= {arXiv preprint arXiv:2405.16803},
year = {2024}
}