NanoFLUX:面向移动设备的大型文本到图像生成模型的提取驱动压缩
计算机视觉与模式识别
2026-02-09 v1 人工智能
摘要
尽管大规模文本到图像扩散模型在视觉质量方面不断提升,但其规模的增加加大了与现有设备解决方案之间的差距。为此,我们引入 NanoFLUX,这是一个来自 17B FLUX.1-Schnell 的 2.4B 文本到图像流匹配模型,通过设计用于保留生成质量的渐进式压缩管线实现。我们的贡献包括:(1) 一种由修剪扩散变换器中冗余组件驱动的模型压缩策略,将其规模从 12B 缩减至 2B;(2) 一种基于 ResNet 的 token 下采样机制,通过允许中间块在较低分辨率的 token 上运算而保留高分辨率处理,从而降低延迟;(3) 一种新的文本编码器提取方法,利用去噪器早期层的视觉信号进行采样。经实验验证,NanoFLUX 在移动设备上约 2.5 秒内可生成 512 x 512 的图像,证明了高质量设备端文本到图像生成的可行性。
引用
@article{arxiv.2602.06879,
title = {NanoFLUX: Distillation-Driven Compression of Large Text-to-Image Generation Models for Mobile Devices},
author = {Ruchika Chavhan and Malcolm Chadwick and Alberto Gil Couto Pimentel Ramos and Luca Morreale and Mehdi Noroozi and Abhinav Mehrotra},
journal= {arXiv preprint arXiv:2602.06879},
year = {2026}
}