中文

利用逐层记忆提升图像生成的可编辑性

计算机视觉与模式识别 2025-05-05 v1 图像与视频处理

摘要

大多数现实世界的图像编辑任务需要多次顺序编辑才能达到预期效果。当前的编辑方法主要针对单对象修改设计,难以应对顺序编辑:尤其是在保持先前编辑的同时,将新对象自然地融入现有内容。这些局限性严重阻碍了需要修改多个对象同时保持其上下文关系的复杂编辑场景。我们通过两个关键提议来解决这一根本性挑战:支持粗略掩码输入,在保留现有内容的同时自然集成新元素;以及支持跨多次修改的一致编辑。我们的框架通过逐层记忆实现这一点,该记忆存储了先前编辑的潜在表示和提示嵌入。我们提出了背景一致性引导,利用记忆的潜在变量来维持场景连贯性;并在交叉注意力中提出多查询解耦,确保新元素与现有内容的自然适应。为评估我们的方法,我们提出了一个新的基准数据集,其中包含语义对齐指标和交互式编辑场景。通过全面的实验,我们证明了在迭代图像编辑任务中以最少的用户努力实现了卓越的性能,仅需粗糙掩码即可在多个编辑步骤中保持高质量结果。

关键词

引用

@article{arxiv.2505.01079,
  title  = {Improving Editability in Image Generation with Layer-wise Memory},
  author = {Daneul Kim and Jaeah Lee and Jaesik Park},
  journal= {arXiv preprint arXiv:2505.01079},
  year   = {2025}
}

备注

CVPR 2025. Project page : https://carpedkm.github.io/projects/improving_edit/index.html