中文

FLUX 是否已经掌握了执行物理上合情的图像组成?

计算机视觉与模式识别 2026-03-03 v4 人工智能 机器学习

摘要

图像组成旨在将用户指定的对象无缝插入新场景,但现有模型在处理复杂光照(如准确阴影、水面反射)以及多样化、高分辨率输入方面存在挑战。现代文本到图像扩散模型(如 SD3.5、FLUX)已经编码了基本的物理和分辨率先验,但缺乏一种框架来充分发挥这些先验的潜力,而不必依赖潜在反转,这种方法往往会将物体姿态锁定在不恰当的方向上,或依赖脆弱的注意力手术。我们提出了 SHINE,一个无训练框架,用于无缝高保真插入并消除误差。SHINE 引入了由流形引导的锚点损失,利用预训练的定制适配器(如 IP-Adapter)来指导潜在表示,以实现对主体表示的忠实性同时保持背景完整性。提出了降解抑制引导和自适应背景混合,以进一步消除低质量输出和可见的接缝。为解决缺乏严谨基准测试的问题,我们引入了 ComplexCompo,包含多样分辨率和具有挑战性的条件,如低光照、强光照、复杂阴影和反射表面。在 ComplexCompo 和 DreamEditBench 上的实验显示,在标准指标(如 DINOv2)和人类对齐评分(如 DreamSim、ImageReward、VisionReward)方面均实现了最先进的性能。代码已公开于 https://github.com/ZhumingLian/SHINE。

关键词

引用

@article{arxiv.2509.21278,
  title  = {Does FLUX Already Know How to Perform Physically Plausible Image Composition?},
  author = {Shilin Lu and Zhuming Lian and Zihan Zhou and Shaocong Zhang and Chen Zhao and Adams Wai-Kin Kong},
  journal= {arXiv preprint arXiv:2509.21278},
  year   = {2026}
}

备注

Accepted by ICLR 2026