中文

ReEdit:基于多模态示例的图像编辑扩散模型方法

计算机视觉与模式识别 2024-11-07 v1

摘要

现代文本到图像(T2I)扩散模型通过生成高质量照片级真实图像,彻底革新了图像编辑领域。虽然利用文本指令进行编辑是T2I模型的事实标准方法,但由于自然语言与图像之间复杂的多对多映射关系,该方法存在相当的难度。本工作研究基于示例的图像编辑——即将一对示例中的编辑迁移到内容图像上的任务。我们提出ReEdit,一个模块化且高效的端到端框架,能够同时捕捉文本和图像模态中的编辑信息,并确保编辑后图像的保真度。我们通过与最先进基线的广泛比较以及对关键设计选择的敏感性分析,验证了ReEdit的有效性。结果表明,ReEdit在定性和定量两方面均持续优于现有方法。此外,ReEdit具有很高的实际适用性,因为它不需要任何任务特定的优化,且速度是下一个最佳基线的四倍。

关键词

引用

@article{arxiv.2411.03982,
  title  = {ReEdit: Multimodal Exemplar-Based Image Editing with Diffusion Models},
  author = {Ashutosh Srivastava and Tarun Ram Menta and Abhinav Java and Avadhoot Jadhav and Silky Singh and Surgan Jandial and Balaji Krishnamurthy},
  journal= {arXiv preprint arXiv:2411.03982},
  year   = {2024}
}

备注

First three authors contributed equally to this work