中文

FLUX.1 Kontext: 潜空间中上下文图像生成与编辑的流匹配

图形学 2025-06-25 v2

摘要

我们展示了FLUX.1 Kontext的评估结果,这是一个统一的图像生成和编辑的生成式流匹配模型。该模型通过整合文本和图像输入的语义上下文来生成新颖的输出视图。使用简单的序列拼接方法,FLUX.1 Kontext在单个统一架构内处理局部编辑和生成式上下文任务。与当前在多次迭代中表现出角色一致性和稳定性下降的编辑模型相比,我们观察到FLUX.1 Kontext改进了对象和角色的保持,从而在迭代工作流程中具有更强的鲁棒性。该模型在实现显著更快的生成时间的同时,达到了与当前最先进系统相竞争的性能,从而支持交互式应用和快速原型制作工作流程。为了验证这些改进,我们引入了KontextBench,一个包含1026个图像-提示对的综合基准,涵盖五个任务类别:局部编辑、全局编辑、角色参考、风格参考和文本编辑。详细的评估显示了FLUX.1 Kontext在单次生成质量和多次迭代一致性方面的优越性能,为统一的图像处理模型设立了新标准。

关键词

引用

@article{arxiv.2506.15742,
  title  = {FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space},
  author = {Black Forest Labs and Stephen Batifol and Andreas Blattmann and Frederic Boesel and Saksham Consul and Cyril Diagne and Tim Dockhorn and Jack English and Zion English and Patrick Esser and Sumith Kulal and Kyle Lacey and Yam Levi and Cheng Li and Dominik Lorenz and Jonas Müller and Dustin Podell and Robin Rombach and Harry Saini and Axel Sauer and Luke Smith},
  journal= {arXiv preprint arXiv:2506.15742},
  year   = {2025}
}