中文

SimDA:用于高效视频生成的简单扩散适配器

计算机视觉与模式识别 2023-08-21 v1 人工智能

摘要

近期 AIGC 浪潮见证了文本到图像(T2I)技术的巨大发展与成功。相比之下,文本到视频(T2V)虽吸引越来越多关注,但仍未达预期。现有工作或从零训练或适配大型 T2I 模型至视频,二者均计算与资源昂贵。在本工作中,我们提出一种简单扩散适配器(SimDA),仅微调强大 T2I 模型中 1.1B 参数里的 24M,以参数高效方式适配至视频生成。特别地,我们通过设计轻量空间与时间适配器进行迁移学习,将 T2I 模型转为 T2V。此外,我们将原始空间注意力改为所提出的潜移注意力(LSA)以保证时间一致性。在相似模型架构下,我们进一步训练视频超分辨率模型以生成高清(1024x1024)视频。除野外 T2V 生成外,SimDA 也可用于单次视频编辑,仅需 2 分钟调参。如此,我们的方法以极少可调参数实现模型适配的最小训练代价。

关键词

引用

@article{arxiv.2308.09710,
  title  = {SimDA: Simple Diffusion Adapter for Efficient Video Generation},
  author = {Zhen Xing and Qi Dai and Han Hu and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2308.09710},
  year   = {2023}
}