解构 FLUX 架构
计算机视觉与模式识别
2025-07-15 v1
摘要
FLUX.1 是由 Black Forest Labs 开发的基于扩散的文本到图像生成模型,旨在实现文本-图像间的忠实对齐,同时保持高图像质量和多样性。FLUX 在文本到图像生成方面被认为是最先进的模型,超过了诸如 Midjourney、DALL-E 3、Stable Diffusion 3 (SD3) 和 SDXL 等流行模型。尽管作为开源模型公开,但作者并未发布官方技术文件详细阐述该模型的架构或训练设置。本报告总结了一项广泛的逆向工程工作,旨在直接从其源代码中解构 FLUX 的架构,以支持其作为未来研究和开发的底层技术。本文件是一份非官方技术报告,未经原开发人员或其关联机构的官方出版或认可。
引用
@article{arxiv.2507.09595,
title = {Demystifying Flux Architecture},
author = {Or Greenberg},
journal= {arXiv preprint arXiv:2507.09595},
year = {2025}
}