Repack 然后 Refine:基于视觉基础模型的高效扩散 Transformer
计算机视觉与模式识别
2026-05-15 v3
摘要
视觉基础模型 (VFM) 的语义丰富特征已被用于增强潜在扩散模型 (LDM)。然而,原始 VFM 特征通常高维且冗余,增加了学习难度并降低了扩散 Transformer (DiT) 的训练效率。本文提出 Repack then Refine,一个三阶段框架,将语义丰富的 VFM 特征引入 DiT,同时进一步加速学习效率。具体而言,Repack 模块将高维特征投影到紧凑的低维流形上,在过滤冗余的同时保留关键结构信息。随后,标准 DiT 在此高度压缩的潜在空间上进行生成建模训练。最后,为恢复 Repack 压缩过程中丢失的高频细节,我们提出 Latent-Guided Refiner,最后训练用于增强图像细节。在 ImageNet-1K 上,RePack-DiT-XL/1 仅用 64 个训练周期即达到 FID 1.82。通过 Refiner 模块,性能进一步提升至 FID 1.65,在收敛效率方面显著超越最新 LDM。我们的结果表明,先打包 VFM 特征再进行针对性细化,是平衡生成保真度与训练效率的高效策略。源代码已公开发布于 https://github.com/guanfangdong/RePack-then-Refine。
引用
@article{arxiv.2512.12083,
title = {RePack then Refine: Efficient Diffusion Transformer with Vision Foundation Model},
author = {Guanfang Dong and Luke Schultz and Negar Hassanpour and Chao Gao},
journal= {arXiv preprint arXiv:2512.12083},
year = {2026}
}