VividPose:推动稳定视频扩散实现逼真的人类图像动画
计算机视觉与模式识别
2024-05-29 v1
摘要
人类图像动画涉及根据指定的姿态序列从静态图像生成视频。当前方法通常采用多阶段管道分别学习外观和运动,常导致外观退化和时间不一致性。为解决此问题,我们提出了 VividPose,一种基于 Stable Video Diffusion (SVD) 的创新式端到端管道,确保了卓越的时间稳定性。为增强人类身份认知, 我们提出了一种身份感知外观控制器,将额外的面部信息集成而不损害其他外观细节如服装纹理和背景。此方法确保生成的视频在人类主体身份上保持高度保真, 在各种姿态下保留关键面部特征。为适应多样化的人类体形和手部动作, 我们引入几何感知姿态控制器,利用来自 SMPL-X 的稠密渲染图和稀疄骨架图。这使我们能够准确对齐生成视频中的姿态和形状, 为处理广泛体形和动态手部动作提供了稳健框架。 在 UBCFashion 和 TikTok 基准上的大量定性和定量实验表明,我们的方法实现了最先进的性能。此外, VividPose 在我们提出的野外数据集上表现出卓越的泛化能力。代码和模型将提供。
引用
@article{arxiv.2405.18156,
title = {VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation},
author = {Qilin Wang and Zhengkai Jiang and Chengming Xu and Jiangning Zhang and Yabiao Wang and Xinyi Zhang and Yun Cao and Weijian Cao and Chengjie Wang and Yanwei Fu},
journal= {arXiv preprint arXiv:2405.18156},
year = {2024}
}