中文

CannyEdit: 选择性 Canny 控制与双提示引导的无需训练图像编辑

计算机视觉与模式识别 2025-10-28 v2 人工智能

摘要

近期文本到图像(T2I)模型的进展使得利用基础模型的生成先验进行无需训练的区域图像编辑成为可能。然而,现有方法难以在编辑区域的文本一致性、未编辑区域的上下文保真度以及编辑的无缝融合之间取得平衡。我们提出了 CannyEdit,一个通过两项关键创新解决这一三难困境的新型无需训练框架。首先,选择性 Canny 控制仅将来自 Canny ControlNet 的结构引导应用于未编辑区域,在保留原始图像细节的同时允许在指定可编辑区域内进行精确的文本驱动修改。其次,双提示引导同时利用针对特定编辑的局部提示和针对整体场景一致性的全局提示。通过这种协同方法,这些组件实现了对对象添加、替换和删除的可控局部编辑,在文本一致性、上下文保真度和编辑无缝性方面相比现有基于区域的方法取得了更优的权衡。此外,CannyEdit 提供了卓越的灵活性:在添加任务中,它能有效处理粗糙掩码甚至单点提示。进一步地,该框架能够以无需训练的方式与视觉语言模型无缝集成,实现需要规划和推理的复杂指令式编辑。我们的大量评估表明,CannyEdit 在复杂对象添加场景中优于领先的指令式编辑器。

关键词

引用

@article{arxiv.2508.06937,
  title  = {CannyEdit: Selective Canny Control and Dual-Prompt Guidance for Training-Free Image Editing},
  author = {Weiyan Xie and Han Gao and Didan Deng and Kaican Li and April Hua Liu and Yongxiang Huang and Nevin L. Zhang},
  journal= {arXiv preprint arXiv:2508.06937},
  year   = {2025}
}

备注

Project Page: vaynexie.github.io/CannyEdit/; MindSpore Code: github.com/mindspore-lab/mindone/tree/master/examples/canny_edit; PyTorch Code: github.com/vaynexie/CannyEdit