SuperEdit:纠正并促进基于指令的图像编辑的监督信号
计算机视觉与模式识别
2025-05-06 v1 人工智能
机器学习
摘要
由于手动收集精确编辑数据的挑战,现有数据集通常使用各种自动化方法构建,导致编辑指令与原始-编辑图像对之间的不匹配产生噪声监督信号。近期的努力试图通过生成更高质量的编辑图像、在识别任务上进行预训练或引入视觉-语言模型(VLM)来改进编辑模型,但未能解决这一根本问题。在本文中,我们通过为给定图像对构建更有效的编辑指令,提供了一种新颖的解决方案。这包括纠正编辑指令以更好地与原始-编辑图像对对齐,以及使用对比编辑指令进一步增强其有效性。具体来说,我们发现编辑模型在不同的推理步骤中表现出特定的生成属性,且这些属性与文本无关。基于这些先验属性,我们为VLM定义了一个统一的指南来纠正编辑指令。然而,存在一些仅凭纠正指令无法解决的具有挑战性的编辑场景。为此,我们进一步构建了包含正指令和负指令的对比监督信号,并使用三元组损失将其引入模型训练,从而进一步提升监督有效性。我们的方法不需要先前工作中使用的VLM模块或预训练任务,为提供更好的监督信号提供了一种更直接、更高效的方式,并为基于指令的图像编辑提供了一种新颖、简单且有效的解决方案。在多个基准测试上的结果表明,我们的方法显著优于现有方法。与先前的最优模型SmartEdit相比,我们在Real-Edit基准上实现了9.19%的提升,同时训练数据减少了30倍,模型尺寸缩小了13倍。
引用
@article{arxiv.2505.02370,
title = {SuperEdit: Rectifying and Facilitating Supervision for Instruction-Based Image Editing},
author = {Ming Li and Xin Gu and Fan Chen and Xiaoying Xing and Longyin Wen and Chen Chen and Sijie Zhu},
journal= {arXiv preprint arXiv:2505.02370},
year = {2025}
}
备注
Code, Data and Models are available at: https://github.com/bytedance/SuperEdit