中文

InstructGIE:迈向可泛化的图像编辑

计算机视觉与模式识别 2024-07-23 v2

摘要

近期图像编辑的进展由去噪扩散模型的发展所驱动,标志着该领域的重大飞跃。尽管取得了这些进展,近期图像编辑方法的泛化能力仍然受限。为应对这一挑战,本研究引入了一种新的图像编辑框架,通过增强上下文学习能力和统一语言指令来提升泛化鲁棒性。该框架 Incorporates 一个专门为图像编辑任务优化的模块,利用 VMamba Block 和编辑偏移匹配策略来增强上下文学习。此外,我们揭示了一种选择性区域匹配技术,专门用于解决和纠正生成图像中损坏的细节(如人脸特征),以进一步提高质量。我们方法的另一个关键创新是集成了语言统一技术,该技术将语言嵌入与编辑语义对齐,以提升图像编辑质量。此外,我们编译了第一个包含视觉提示和编辑指令的图像编辑数据集,可用于增强上下文能力。在该数据集上训练后,我们的方法不仅在训练任务上实现了卓越的合成质量,而且通过定制提示在未见过的视觉任务中展示了强大的泛化能力。

关键词

引用

@article{arxiv.2403.05018,
  title  = {InstructGIE: Towards Generalizable Image Editing},
  author = {Zichong Meng and Changdi Yang and Jun Liu and Hao Tang and Pu Zhao and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2403.05018},
  year   = {2024}
}

备注

ECCV2024