重新思考草稿引导的图像编辑:泛化、指令遵循与多任务
计算机视觉与模式识别
2026-05-26 v1
摘要
草稿引导的图像编辑允许用户将简单的草稿注释与文本提示组合,以指定图像应如何以及在何处进行编辑,从而实现灵活的交互并具备精确的空间控制。然而,现有模型在此范式下仍表现不稳定,尤其在多任务场景中效果更为突出。为提升性能,我们使用开源编辑模型进行经验研究,发现泛化存在不对称性:指令层面的泛化(包括跨编辑任务以及从单任务到多任务的设置)比图像域的泛化(如从合成到真实图像,或从马赛克图像到常规图像)更具挑战性。这表明主要瓶颈在于对多样化编辑指令的学习不足,而非图像域差距。基于此洞见,我们提出三种策略:(a)覆盖式-真实性课程 curriculum,这是一个两阶段流程,首先构建大规模合成、指令丰富的数据以获得广泛的任务监督,然后筛选一小部分真实数据以细化生成的真实性;(b)多任务马赛克化,通过在几乎零成本下拼接单任务示例来构建多任务训练样本,同时使所学能力能够泛化到非马赛克图像;(c)编辑聚焦损失,利用合成数据中输入与输出图像之间变化区域,以聚焦训练中的编辑区域,提高学习效率和编辑准确性。通过这些策略,我们在VIBE基准上显著提升了单任务和多任务草稿引导编辑性能,实现了最先进的效果。我们将公开发布数据集和模型。
引用
@article{arxiv.2605.25568,
title = {Rethinking Scribble-Guided Image Editing: Generalization, Instruction Adherence, and Multi-Tasking},
author = {Mingyi Xu and Jinpeng Lin and Min Zhou and Tiezheng Ge and Ming Zeng},
journal= {arXiv preprint arXiv:2605.25568},
year = {2026}
}