InstructEdit:利用用户指令改进基于扩散模型的图像编辑的自动掩码
计算机视觉与模式识别
2023-05-30 v1
摘要
近期工作已探索使用扩散模型进行文本引导的图像编辑,并基于文本提示生成编辑后的图像。然而,这些模型难以准确定位待编辑区域并忠实执行精确编辑。在本工作中,我们提出一个名为 InstructEdit 的框架,可基于用户指令进行细粒度编辑。我们提出的框架包含三个组件:语言处理器、分割器和图像编辑器。第一个组件即语言处理器,使用大语言模型处理用户指令,其目标是解析用户指令并为分割器输出提示、为图像编辑器输出描述文本。我们在此步骤采用 ChatGPT 并可选采用 BLIP2。第二个组件即分割器,使用语言处理器提供的分割提示,我们采用最先进的分割框架 Grounded Segment Anything 基于该分割提示自动生成高质量掩码。第三个组件即图像编辑器,利用语言处理器的描述文本和分割器的掩码计算编辑后的图像,我们为此采用 Stable Diffusion 以及来自 DiffEdit 的掩码引导生成。实验表明,在输入图像包含复杂物体或多个物体的细粒度编辑应用中,我们的方法优于以往的编辑方法。我们相比 DiffEdit 提升了掩码质量,从而改善了编辑图像的质量。我们还展示了我们的框架可接受多种形式的用户指令作为输入。我们在 https://github.com/QianWangX/InstructEdit 提供了代码。
引用
@article{arxiv.2305.18047,
title = {InstructEdit: Improving Automatic Masks for Diffusion-based Image Editing With User Instructions},
author = {Qian Wang and Biao Zhang and Michael Birsak and Peter Wonka},
journal= {arXiv preprint arXiv:2305.18047},
year = {2023}
}
备注
Project page: https://qianwangx.github.io/InstructEdit/