中文

从单张图像生成具有3D姿态和视角控制的人类视频

计算机视觉与模式识别 2026-02-25 v1

摘要

近期扩散方法因其强大的视觉生成能力在从单张图像生成视频方面取得了显著进展。然而,在图像到视频合成中,尤其是在人类视频生成方面,仍面临挑战,特别是从单张图像推断视角一致、运动相关的衣物皱褶问题。本文提出了人类视频生成于4D(HVG),一种潜在视频扩散模型,能够从单张图像生成具有3D姿态和视角控制的高质量、多视角、时空连贯的人类视频。HVG通过三个关键设计实现了这一目标:(i)通过一种新颖的双维骨骼图捕获3D关节的解剖关系,并通过引入3D信息解决跨视角的自遮挡问题;(ii)视角和时间对齐,确保参考图像和姿态序列之间的多视角一致性和对齐,以实现帧与帧之间的稳定性;(iii)结合时间对齐的渐进式时空抽样,以保持长期多视角动画的平滑过渡。广泛的图像到视频任务实验表明,HVG在生成来自多样化人类图像和姿态输入的高质量4D人类视频方面优于现有方法。

关键词

引用

@article{arxiv.2602.21188,
  title  = {Human Video Generation from a Single Image with 3D Pose and View Control},
  author = {Tiantian Wang and Chun-Han Yao and Tao Hu and Mallikarjun Byrasandra Ramalinga Reddy and Ming-Hsuan Yang and Varun Jampani},
  journal= {arXiv preprint arXiv:2602.21188},
  year   = {2026}
}