OmniEdit: 通过专家模型监督构建图像编辑通才模型
计算机视觉与模式识别
2025-04-29 v2 人工智能
摘要
指令引导的图像编辑方法通过在自动合成或人工标注的图像编辑对上训练扩散模型,展现了巨大潜力。然而,这些方法距离实际、真实生活的应用仍有很大差距。我们确定了导致这一差距的三个主要挑战。首先,由于合成过程存在偏差,现有模型的编辑技能有限。其次,这些方法使用的数据集包含大量噪声和伪影,这是由于应用了简单的过滤方法如CLIP分数。第三,所有这些数据集仅限于单一低分辨率和固定宽高比,限制了处理真实世界用例的通用性。在本文中,我们提出了OmniEdit,这是一个能够无缝处理七种不同图像编辑任务且支持任意宽高比的全能编辑器。我们的贡献有四点:(1) OmniEdit利用七个不同专家模型的监督进行训练,以确保任务覆盖。(2) 我们利用大型多模态模型(如GPT-4o)提供的分数进行重要性采样,而非CLIP分数,以提高数据质量。(3) 我们提出了一种新的编辑架构EditNet,大幅提升编辑成功率。(4) 我们提供不同宽高比的图像,以确保我们的模型能处理任意真实图像。我们策划了一个包含不同宽高比图像的测试集,配以多样化的指令以覆盖不同任务。自动评估和人工评估均表明,OmniEdit显著优于所有现有模型。我们的代码、数据集和模型将在https://tiger-ai-lab.github.io/OmniEdit/发布。
引用
@article{arxiv.2411.07199,
title = {OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision},
author = {Cong Wei and Zheyang Xiong and Weiming Ren and Xinrun Du and Ge Zhang and Wenhu Chen},
journal= {arXiv preprint arXiv:2411.07199},
year = {2025}
}
备注
21 pages