FlexiDiT:您的扩散 Transformer 能通过降低计算资源生成高质量样本
计算与语言
2025-06-04 v3 机器学习
摘要
尽管现代扩散 Transformer 在性能方面取得了显著成果,但其在推理阶段因固定且大量计算资源要求受限。本文重新审视了将固定计算预算分配给每个去噪迭代的传统范式,提出了动态策略。我们的简单且样本高效框架使预训练的 DiT 模型能够转换为\emph{灵活}模型——即称为 FlexiDiT 的模型——可在不同计算预算下处理输入。我们展示了单个\emph{灵活}模型能够在不牺牲质量的情况下生成图像,同时将其静态等效方法所需的 FLOPs 降低超过 40%,适用于类别条件和文本条件图像生成。我们的方法通用且不依赖于输入和条件模态。我们展示了该方法可轻松扩展用于视频生成,其中 FlexiDiT 模型在不牺牲性能的情况下生成的样本计算量降低最高可达 75%。
引用
@article{arxiv.2502.20129,
title = {Finite State Automata Inside Transformers with Chain-of-Thought: A Mechanistic Study on State Tracking},
author = {Yifan Zhang and Wenyu Du and Dongming Jin and Jie Fu and Zhi Jin},
journal= {arXiv preprint arXiv:2502.20129},
year = {2025}
}