中文

LORE:基于整流流的图像编辑中精准语义控制的潜在优化

计算机视觉与模式识别 2025-08-22 v2

摘要

文本驱动的图像编辑使用户能够通过自然语言指令灵活地修改视觉内容,广泛应用于语义对象替换、插入和删除等任务。尽管最近的基于逆转方法的编辑方法使用整流流模型在图像质量方面取得了有前景的成果,但我们识别出其编辑行为存在结构性局限:对源概念编码的语义偏差倾向于抑制对目标概念的注意力。这一问题在源语义与目标语义差异较大时尤为关键,注意力机制本身会导致编辑失败或对非目标区域进行意外修改。本文系统性地分析并验证了这一结构性缺陷,提出 LORE,这是一种无需训练即可高效的图像编辑方法。LORE 直接优化逆转噪声,解决了现有方法在泛化性和可控性方面的核心限制,实现了稳定、可控且通用的概念替换,无需架构修改或模型微调。我们在三个具有挑战性的基准测试上进行了全面评估:PIEBench、SmartEdit 和 GapEdit。实验结果表明,LORE 在语义对齐性、图像质量和背景保真度方面均显著优于强大基线,展示了潜在空间优化在通用图像编辑中的有效性和可扩展性。我们的实现已公开于 https://github.com/oyly16/LORE。

关键词

引用

@article{arxiv.2508.03144,
  title  = {LORE: Latent Optimization for Precise Semantic Control in Rectified Flow-based Image Editing},
  author = {Liangyang Ouyang and Jiafeng Mao},
  journal= {arXiv preprint arXiv:2508.03144},
  year   = {2025}
}

备注

Our implementation is available at https://github.com/oyly16/LORE