中文

KV-Edit:面向精确背景保留的无训练图像编辑

计算机视觉与模式识别 2025-03-13 v3

摘要

在图像编辑任务中,背景一致性仍然是一个重大挑战。尽管已有广泛发展,现有工作在保持与原始图像的相似性和生成与目标对齐的内容之间仍面临权衡。在此,我们提出了 KV-Edit,这是一种无训练方法,利用 DiTs 中的 KV 缓存来保持背景一致性,其中背景 token 被保留而不是重新生成,从而消除了对复杂机制或昂贵训练的需求,最终在用户提供的区域内生成与背景无缝集成的新内容。我们进一步探讨了编辑过程中 KV 缓存的内存消耗,并使用无反演方法将空间复杂度优化至 O(1)O(1)。我们的方法无需额外训练即可与任何基于 DiT 的生成模型兼容。实验表明,KV-Edit 在背景和图像质量方面均显著优于现有方法,甚至超越了基于训练的方法。项目网页可在 https://xilluill.github.io/projectpages/KV-Edit 获取

关键词

引用

@article{arxiv.2502.17363,
  title  = {KV-Edit: Training-Free Image Editing for Precise Background Preservation},
  author = {Tianrui Zhu and Shiyi Zhang and Jiawei Shao and Yansong Tang},
  journal= {arXiv preprint arXiv:2502.17363},
  year   = {2025}
}

备注

Project webpage is available at https://xilluill.github.io/projectpages/KV-Edit