LaVin-DiT:大型视觉扩散 Transformer
计算机视觉与模式识别
2025-03-07 v4
摘要
本文提出了大型视觉扩散 Transformer(LaVin-DiT),这是一种可扩展且统一的基础模型,旨在以生成式框架解决 20 多种计算机视觉任务。现有的大型视觉模型大多直接改编自自然语言处理架构,它们依赖于效率较低的自主回归技术,并破坏了对视觉数据至关重要的空间关系。与此不同,LaVin-DiT 引入了关键创新以优化视觉任务的生成性能。首先,为解决视觉数据的高维度问题,我们引入了时空变分自编码器,将数据编码至连续的潜在空间中。其次,用于生成建模,我们开发了联合扩散 Transformer,逐步生成视觉输出。第三,为实现统一的多任务训练,我们实现了上下文学习。输入-目标对作为任务上下文,引导扩散 Transformer 在潜在空间内将输出与特定任务对齐。在推理阶段,特定任务上下文集与作为查询的测试数据使得 LaVin-DiT 无需微调即可跨任务泛化。该模型在广泛的视觉数据集上训练,参数规模从 0.1B 扩展至 3.4B,在多种视觉任务中展现出显著的扩展性和最先进的性能。本工作为大型视觉基础模型引入了新路径,凸显了扩散 Transformer 的广阔潜力。代码与模型已开源。
引用
@article{arxiv.2411.11505,
title = {LaVin-DiT: Large Vision Diffusion Transformer},
author = {Zhaoqing Wang and Xiaobo Xia and Runnan Chen and Dongdong Yu and Changhu Wang and Mingming Gong and Tongliang Liu},
journal= {arXiv preprint arXiv:2411.11505},
year = {2025}
}
备注
37 pages, 30 figures, 4 tables. Accepted by CVPR 2025