中文

UniAnimate:驯服统一视频扩散模型以实现一致的人体图像动画

计算机视觉与模式识别 2024-06-04 v1

摘要

最近基于扩散的人体图像动画技术在合成视频方面取得了令人瞩目的成功,这些视频能够忠实地遵循给定的参考身份和一系列所需的运动姿态。尽管如此,仍然存在两个局限性:i) 需要一个额外的参考模型来将身份图像与主视频分支对齐,这显著增加了优化负担和模型参数;ii) 生成的视频通常时间较短(例如,24帧),阻碍了实际应用。为了解决这些缺点,我们提出了一个UniAnimate框架,以实现高效且长期的人体视频生成。首先,为了降低优化难度并确保时间一致性,我们通过整合一个统一的视频扩散模型,将参考图像连同姿态引导和噪声视频映射到一个共同的特征空间。其次,我们提出了一种统一的噪声输入,支持随机噪声输入以及首帧条件输入,这增强了生成长视频的能力。最后,为了进一步高效处理长序列,我们探索了一种基于状态空间模型的替代时间建模架构,以取代原本计算量大的时间Transformer。大量的实验结果表明,UniAnimate在定量和定性评估中均优于现有的最先进方法,取得了卓越的合成结果。值得注意的是,UniAnimate甚至可以通过迭代地使用首帧条件策略来生成高度一致的一分钟视频。代码和模型将公开提供。项目页面:https://unianimate.github.io/。

关键词

引用

@article{arxiv.2406.01188,
  title  = {UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation},
  author = {Xiang Wang and Shiwei Zhang and Changxin Gao and Jiayu Wang and Xiaoqiang Zhou and Yingya Zhang and Luxin Yan and Nong Sang},
  journal= {arXiv preprint arXiv:2406.01188},
  year   = {2024}
}

备注

Project page: https://unianimate.github.io/