中文

Emu Edit:通过识别与生成任务实现精确图像编辑

计算机视觉与模式识别 2023-11-17 v1 人工智能 机器学习

摘要

基于指令的图像编辑因允许用户使用自然语言指令执行任意编辑操作而具有巨大应用潜力。然而,该领域当前模型常难以准确执行用户指令。我们提出 Emu Edit,一种多任务图像编辑模型,在基于指令的图像编辑上取得了最先进(SOTA)结果。为开发 Emu Edit,我们将其训练为前所未有的广泛任务上的多任务,如基于区域的编辑、自由形式编辑以及计算机视觉(Computer Vision)任务,所有这些均被表述为生成任务。此外,为增强 Emu Edit 的多任务学习能力,我们为其提供习得任务嵌入,以引导生成过程朝向正确的编辑类型。这两要素对 Emu Edit 的卓越性能至关重要。进一步,我们展示 Emu Edit 仅需少量标注样本即可泛化到新任务,如图像修复、超分辨率及编辑任务组合。该能力在高质量样本稀缺的场景中优势显著。最后,为促进对可指令图像编辑模型更严格且知情的评估,我们发布了一个包含七种不同图像编辑任务的新颖且具挑战性的通用基准。

关键词

引用

@article{arxiv.2311.10089,
  title  = {Emu Edit: Precise Image Editing via Recognition and Generation Tasks},
  author = {Shelly Sheynin and Adam Polyak and Uriel Singer and Yuval Kirstain and Amit Zohar and Oron Ashual and Devi Parikh and Yaniv Taigman},
  journal= {arXiv preprint arXiv:2311.10089},
  year   = {2023}
}