FullDiT:用于多任务视频生成的全注意力基础模型
计算机视觉与模式识别
2025-03-26 v1
摘要
当前视频生成基础模型主要聚焦于文本到视频任务,难以提供细粒度视频内容创建的精确控制。虽然基于适配器的方法(如ControlNet)通过最小微调实现额外控制,但在集成多个条件时面临分支冲突、参数冗余导致的计算成本增加以及与完全微调相比性能不足等挑战。为此,我们引入FullDiT,一个用于视频生成的统一基础模型,通过统一的全注意力机制无缝集成多个条件。通过将多任务条件融合为统一的序列表示,并利用全自注意力的长程上下文学习能力捕捉条件动态,FullDiT降低了参数开销,避免了条件冲突,显示出良好的可扩展性和涌现能力。我们进一步引入FullBench用于多任务视频生成评估。实验表明,FullDiT在多个任务上实现了最先进的效果,凸显了全注意力在复杂多任务视频生成中的有效性。
引用
@article{arxiv.2503.19907,
title = {FullDiT: Multi-Task Video Generative Foundation Model with Full Attention},
author = {Xuan Ju and Weicai Ye and Quande Liu and Qiulin Wang and Xintao Wang and Pengfei Wan and Di Zhang and Kun Gai and Qiang Xu},
journal= {arXiv preprint arXiv:2503.19907},
year = {2025}
}
备注
Project Page: https://fulldit.github.io/