中文

Lumina-T2X:基于流变的大型扩散Transformer将文本转换为任意模态、分辨率和持续时间

计算机视觉与模式识别 2024-06-14 v3

摘要

Sora 展示了通过扩大 Diffusion Transformer 的规模来生成任意分辨率、宽高比和持续时间的照片实感图像和视频的潜力,但其仍缺乏足够的实现细节。本技术报告中,我们介绍了 Lumina-T2X 系列——一系列基于流变的大型扩散Transformer(Flag-DiT),配备零初始化注意力,作为将噪声转换为以文本指令为条件的图像、视频、多视角3D物体和音频片段的统一框架。通过对潜在时空空间进行标记化,并纳入诸如 [nextline] 和 [nextframe] 等可学习占位符,Lumina-T2X 能够无缝统一不同模态在各种时空分辨率下的表示。这种统一方法使我们能够在单一框架内训练不同模态,并允许在推理期间灵活生成任意分辨率、宽高比和长度的多模态数据。诸如 RoPE、RMSNorm 和流匹配等高级技术提升了 Flag-DiT 的稳定性、灵活性和可扩展性,使 Lumina-T2X 的模型规模可达70亿参数,上下文窗口可扩展至128K token。这对于利用我们拥有的 Lumina-T2I 模型生成超高清图像以及利用 Lumina-T2V 模型生成长时长720p视频尤为有益。值得注意的是,Lumina-T2I 采用50亿参数的 Flag-DiT,只需6000万参数的naive DiT训练计算成本的35%。我们进一步的全面分析强调了Lumina-T2X在分辨率外推、高分辨率编辑、生成一致3D视图以及合成具有平滑过渡的视频方面的初步能力。我们期待Lumina-T2X的开源将进一步促进生成式AI社区的创意、透明度和多样性。

关键词

引用

@article{arxiv.2405.05945,
  title  = {Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers},
  author = {Peng Gao and Le Zhuo and Dongyang Liu and Ruoyi Du and Xu Luo and Longtian Qiu and Yuhang Zhang and Chen Lin and Rongjie Huang and Shijie Geng and Renrui Zhang and Junlin Xi and Wenqi Shao and Zhengkai Jiang and Tianshuo Yang and Weicai Ye and He Tong and Jingwen He and Yu Qiao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2405.05945},
  year   = {2024}
}

备注

Technical Report; Code at: https://github.com/Alpha-VLLM/Lumina-T2X