中文

UniAnimate-DiT:基于大规模视频扩散 Transformer 的人类图像动画

计算机视觉与模式识别 2026-03-24 v1 多媒体

摘要

本报告介绍了 UniAnimate-DiT,这是一个利用开源 Wan2.1 模型在保持原有生成能力基础上的人类图像动画项目。具体而言,为保留 Wan2.1 模型的强大生成能力,我们采用 Low-Rank Adaptation (LoRA) 技术对模型进行微调,只需优化极少数参数,即可显著降低训练内存开销。设计了一个由多个堆叠的 3D 卷积层构成的轻量级姿态编码器,用于编码驱动姿态的运动信息。此外,我们采用简单的拼接操作将参考外观融入模型,并纳入参考图像的姿态信息,以实现更佳的姿态对齐。实验结果表明,我们的方法能够生成视觉逼真且时序一致的高保真动画。在 480p (832×480) 视频上训练后,UniAnimate-DiT 能在推理阶段无缝放大至 720P (1280×720)。训练与推理代码已公开于 https://github.com/ali-vilab/UniAnimate-DiT。

关键词

引用

@article{arxiv.2504.11289,
  title  = {UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer},
  author = {Xiang Wang and Shiwei Zhang and Longxiang Tang and Yingya Zhang and Changxin Gao and Yuehuan Wang and Nong Sang},
  journal= {arXiv preprint arXiv:2504.11289},
  year   = {2026}
}

备注

The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT