中文

从反思到完美:基于反思调谐扩展文本到图像扩散模型的推理时间优化

计算机视觉与模式识别 2025-04-23 v1

摘要

近期文本到图像扩散模型通过大规模训练数据和模型参数的扩展实现了令人瞩目的视觉质量,但常在复杂场景和细粒度细节方面表现不足。灵感来自大型语言模型中不断涌现的自我反思能力,我们提出了ReflectionFlow框架,使扩散模型能够迭代反思并细化其输出。ReflectionFlow引入了三个互补的推理时间扩展维度:(1)噪声水平扩展以优化潜在初始化;(2)提示水平扩展以实现精确语义指导;最重要的是,(3)反思水平扩展,显式提供可操作的反思,以迭代评估和纠正先前的生成。为促进反思水平扩展,我们构建了GenRef数据集,包含100万个三元组,每个三元组包含一条反思、一个有缺陷的图像和一个改进后的图像。利用该数据集,我们在最先进的扩散转换器FLUX.1-dev上高效地进行反思调谐,通过在统一框架中联合建模多模态输入。实验结果表明,ReflectionFlow显著优于朴素的噪声水平扩展方法,为在具有挑战性任务上的更高质量图像合成提供了可扩展且计算高效的解决方案。

关键词

引用

@article{arxiv.2504.16080,
  title  = {From Reflection to Perfection: Scaling Inference-Time Optimization for Text-to-Image Diffusion Models via Reflection Tuning},
  author = {Le Zhuo and Liangbing Zhao and Sayak Paul and Yue Liao and Renrui Zhang and Yi Xin and Peng Gao and Mohamed Elhoseiny and Hongsheng Li},
  journal= {arXiv preprint arXiv:2504.16080},
  year   = {2025}
}

备注

All code, checkpoints, and datasets are available at \url{https://diffusion-cot.github.io/reflection2perfection}