中文

描述而非指令:基于自然语言意图的语义图像编辑

计算机视觉与模式识别 2025-08-29 v1

摘要

尽管文本到图像生成取得了进展,语义图像编辑仍是一项挑战。基于反演的算法不可避免地会引入重建误差,而基于指令的模型主要受限于数据集的质量与规模。为解决这些问题,我们提出了一种基于描述性提示的编辑框架,命名为 DescriptiveEdit。其核心思想是将“基于指令的图像编辑”重新定义为“基于参考图像的文本到图像生成”,从而在无需架构修改或反演的情况下,保留训练良好的文本到图像模型的生成能力。具体而言,以参考图像和提示作为输入,我们引入了一个交叉注意力 UNet,其新增了注意力桥,以将参考图像特征注入到提示到编辑图像的生成过程中。得益于其文本到图像的特性,DescriptiveEdit 克服了指令数据集质量的限制,能与 ControlNet、IP-Adapter 及其他扩展无缝集成,并具有更强的可扩展性。在 Emu Edit 基准上的实验表明,它提升了编辑的准确性与一致性。

关键词

引用

@article{arxiv.2508.20505,
  title  = {Describe, Don't Dictate: Semantic Image Editing with Natural Language Intent},
  author = {En Ci and Shanyan Guan and Yanhao Ge and Yilin Zhang and Wei Li and Zhenyu Zhang and Jian Yang and Ying Tai},
  journal= {arXiv preprint arXiv:2508.20505},
  year   = {2025}
}

备注

Accepted by ICCV 2025