Dense2MoE:重构扩散Transformer为MoE以实现高效文本到图像生成
计算机视觉与模式识别
2025-10-13 v1
摘要
扩散Transformer(DiT)在文本到图像生成中展示了显著性能,然而其庞大的参数规模导致了大量的推理开销。现有的参数压缩方法主要聚焦于剪枝,但激进的剪枝往往因模型容量减少而导致严重的性能退化。为解决这一局限,我们率先将密集DiT转换为专家混合(MoE)结构以实现结构化稀疏化,在保持模型容量的同时减少激活参数数量。具体而言,我们将DiT块中的前馈网络(FFN)替换为MoE层,将FFN中激活参数的数量减少62.5%。此外,我们提出块混合(MoB)以选择性激活DiT块,从而进一步增强稀疏性。为确保有效的密集到MoE转换,我们设计了多步蒸馏流水线,包括基于泰勒度量的专家初始化、带负载均衡的知识蒸馏以及用于MoB优化的组特征损失。我们将大型扩散Transformer(如FLUX.1 [dev])转换为MoE结构,在保持原始性能的同时将激活参数减少60%,并在广泛实验中超越了基于剪枝的方法。总体而言,Dense2MoE为高效文本到图像生成建立了新的范式。
引用
@article{arxiv.2510.09094,
title = {Dense2MoE: Restructuring Diffusion Transformer to MoE for Efficient Text-to-Image Generation},
author = {Youwei Zheng and Yuxi Ren and Xin Xia and Xuefeng Xiao and Xiaohua Xie},
journal= {arXiv preprint arXiv:2510.09094},
year = {2025}
}
备注
Accepted by ICCV 2025