中文

LucidFlux:基于大规模扩散 Transformer 的无描述文本逼真图像复原

计算机视觉与模式识别 2026-05-13 v4

摘要

图像复原(IR)旨在恢复受未知混合因素退化的图像,同时保持语义——在此条件下,判别式复原器与基于 UNet 的扩散先验常常出现过度平滑、幻觉或漂移。我们提出 LucidFlux,一种无需图像描述文本的 IR 框架,无需图像描述文本即可适配大型扩散 Transformer(Flux.1)。我们的 LucidFlux 引入了一个轻量级双分支调节器,分别从退化输入和轻度复原的代理注入信号,以锚定几何结构并抑制伪影。随后,设计了时间步与层自适应调制策略,在主干网络的层级间路由这些线索,以产生从粗到细且具备上下文感知的更新,在恢复纹理的同时保护全局结构。此后,为避免文本提示或视觉语言模型(VLM)描述文本的延迟与不稳定性,我们通过从代理提取的 SigLIP 特征来实施无描述文本的语义对齐。可扩展的数据筛选流水线进一步过滤大规模数据,以提供结构丰富的监督。在合成与真实世界基准上,我们的 LucidFlux 始终优于强大的开源与商业基线,消融实验验证了各组件的必要性。LucidFlux 表明,对于大型 DiT,何时、何地以及以何种内容进行条件控制——而非增加参数或依赖文本提示——是实现真实世界中鲁棒且无描述文本图像复原的关键杠杆。

关键词

引用

@article{arxiv.2509.22414,
  title  = {LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer},
  author = {Song Fei and Tian Ye and Lujia Wang and Lei Zhu},
  journal= {arXiv preprint arXiv:2509.22414},
  year   = {2026}
}

备注

Project Page: https://w2genai-lab.github.io/LucidFlux