中文

PoseCrafter:一种遵循灵活姿态控制的单次个性化视频合成方法

计算机视觉与模式识别 2024-07-19 v3 人工智能

摘要

本文介绍PoseCrafter,这是一种遵循灵活姿态控制的单次个性化视频生成方法。基于Stable Diffusion和ControlNet,我们仔细设计推理流程以生成高质量视频,无需对应的真实帧。首先,我们从训练视频中选取合适的参考帧并对其进行逆向,以初始化生成的所有潜在变量。随后,我们将相应的训练姿态插入目标姿态序列中,通过训练好的时序注意力模块提升保真度。此外,为缓解因训练视频与推理姿态之间差异导致的人脸和手部退化,我们实现了通过包含人脸和手部关键点的仿射变换矩阵的简单潜空间编辑。大量实验表明,PoseCrafter在多个数据集上优于基于大量视频预训练的基线方法,凭借8个常用指标实现卓越表现。此外,PoseCrafter能够遵循来自不同个体或人工编辑的姿态,并在开放域训练视频中保持人类身份。我们的项目页面地址为 https://ml-gsai.github.io/PoseCrafter-demo/。

关键词

引用

@article{arxiv.2405.14582,
  title  = {PoseCrafter: One-Shot Personalized Video Synthesis Following Flexible Pose Control},
  author = {Yong Zhong and Min Zhao and Zebin You and Xiaofeng Yu and Changwang Zhang and Chongxuan Li},
  journal= {arXiv preprint arXiv:2405.14582},
  year   = {2024}
}