Follow Your Pose:基于无姿态视频的姿态引导文本到视频生成
计算机视觉与模式识别
2024-01-04 v2
摘要
生成可文本编辑且姿态可控的角色视频在各类数字人创作中有迫切需求。然而,该任务一直受限于缺乏包含视频-姿态字幕配对的综合数据集以及用于视频的生成先验模型。在本工作中,我们设计了一种新颖的两阶段训练方案,可利用易于获取的数据集(即图像-姿态对和无姿态视频)以及预训练的文本到图像(T2I)模型来获得姿态可控的角色视频。具体而言,在第一阶段,仅使用关键点-图像对进行可控的文本到图像生成,我们学习一个零初始化的卷积编码器来编码姿态信息。在第二阶段,我们通过添加可学习的时间自注意力模块和改良的跨帧自注意力模块,利用无姿态视频数据集对上述网络的运动进行微调。借助我们的新设计,我们的方法在保持预训练 T2I 模型的编辑与概念组合能力的同时,成功生成了连续姿态可控的角色视频。代码与模型将公开可用。
引用
@article{arxiv.2304.01186,
title = {Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos},
author = {Yue Ma and Yingqing He and Xiaodong Cun and Xintao Wang and Siran Chen and Ying Shan and Xiu Li and Qifeng Chen},
journal= {arXiv preprint arXiv:2304.01186},
year = {2024}
}
备注
Project page: https://follow-your-pose.github.io/; Github repository: https://github.com/mayuelala/FollowYourPose