中文

ScribbleEdit:用于图像编辑的带有草图和文本的合成数据集

计算机视觉与模式识别 2026-05-06 v2

摘要

最新的生成模型进展显著推动了图像编辑能力,但精确且直观的用户控制仍然困难。具体而言,用户常常难以同时准确表达空间布局和具体语义细节。虽然自然语言指令能够有效传递诸如纹理和颜色等高层语义,但缺乏空间特定性。相反,免费手绘草图提供粗略的空间边界,却无法表达详细的视觉属性。因此,实现精确控制需要同时结合两种模态。然而,现有模型因缺乏专门的训练数据而难以联合解释抽象草图与文本。本文引入了 ScribbleEdit,一个大规模合成数据集,旨在通过将自然语言指令与免费手绘草图输入组合在一起,以实现更准确、可控的编辑。我们通过一个合成管道自动生成源图像-目标图像对(通过填充),然后配对人类绘制的草图和由视觉语言模型生成的文本指令。使用 ScribbleEdit,我们评估并微调了基于扩散和自回归的统一多模态图像编辑模型。我们的实验表明,虽然现成模型在处理抽象草图输入时表现不佳,但在我们合成的数据集上进行微调后,显著提升了其生成空间对齐且语义一致编辑的能力。

关键词

引用

@article{arxiv.2605.01135,
  title  = {ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text},
  author = {Anya Ji and George Ma and Téa Wright and Yiming Zhang and David M. Chan and Alane Suhr and Somayeh Sojoudi},
  journal= {arXiv preprint arXiv:2605.01135},
  year   = {2026}
}