SANA:高分辨率图像合成的高效线性扩散变换器
计算机视觉与模式识别
2024-10-22 v3
摘要
我们提出Sana,一个可高效生成分辨率达 40964096 的文本到图像框架。Sana 能够以极快的速度合成高分辨率、高质量且文本-图像对齐性强的图像,可在笔记本级 GPU 上部署。核心设计包括:(1)深度压缩自编码器:与传统自编码器仅压缩 8 不同,我们训练的AE可压缩 32,有效减少潜在 token 的数量。(2)线性 DiT:我们将 DiT 中的所有常规注意力替换为线性注意力,在高分辨率下更高效且不牺牲质量。(3)解码器专用的文本编码器:我们将 T5 替换为现代解码器专用小型 LLM 作为文本编码器,并设计复杂的人类指令以利用 in-context learning 提升图像-文本对齐。(4)高效训练与采样:我们提出 Flow-DPM-Solver 以减少采样步骤,结合高效 caption 标注与筛选以加速收敛。结果表明,Sana-0.6B 在吞吐量上比现代巨型扩散模型(如 Flux-12B)竞争力更强,参数规模仅为其 1/20,速度快 100 倍以上。此外,Sana-0.6B 可部署在 16GB 笔记本 GPU 上,仅需不到 1 秒即可生成 10241024 分辨率的图像。Sana 实现了低成本的内容创作。代码和模型将公开释放。
引用
@article{arxiv.2410.10629,
title = {SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformers},
author = {Enze Xie and Junsong Chen and Junyu Chen and Han Cai and Haotian Tang and Yujun Lin and Zhekai Zhang and Muyang Li and Ligeng Zhu and Yao Lu and Song Han},
journal= {arXiv preprint arXiv:2410.10629},
year = {2024}
}
备注
Technical Report