中文

ConsistEdit:高一致性且精确的无训练视觉编辑

计算机视觉与模式识别 2025-10-21 v1

摘要

近期发展中的无训练注意力控制方法已实现灵活且高效的文本导向编辑能力。然而,当前方法在保持编辑强度与源图像一致性方面存在挑战。这一限制在多轮编辑和视频编辑中尤为关键,因为视觉误差会随时间累积。此外,大多数现有方法强制执行全局一致性,这限制了其修改单个属性(如纹理)而保留其他属性的能力,从而阻碍了精细编辑。最近,架构从U-Net转向MM-DiT带来了显著的生成性能提升,引入了一种集成文本和视觉模态的新机制。这些进展为克服以前方法未能解决的挑战奠定了基础。通过对MM-DiT的深入分析,我们识别了其注意力机制的三个关键见解。基于这些见解,我们提出ConsistEdit,一种专为MM-DiT设计的注意力控制方法。ConsistEdit融合了视觉专用注意力控制、掩码引导的预注意力融合以及对查询、键和值token的差异化操控,以实现一致且与提示对齐的编辑。广泛的实验表明,ConsistEdit在广泛的图像和视频编辑任务中实现了最先进的性能,包括结构一致和结构不一致情景。与先前方法不同,它是首个在所有推理步骤和注意力层上进行编辑而无需手工设计的方法,显著增强了可靠性和一致性,使其能够稳健地实现多轮和多区域编辑。此外,它支持结构一致性的渐进式调整,实现更细粒度的控制。

关键词

引用

@article{arxiv.2510.17803,
  title  = {ConsistEdit: Highly Consistent and Precise Training-free Visual Editing},
  author = {Zixin Yin and Ling-Hao Chen and Lionel Ni and Xili Dai},
  journal= {arXiv preprint arXiv:2510.17803},
  year   = {2025}
}

备注

SIGGRAPH Asia 2025