中文

ActCam:面向视频生成的零样本摄像机与三维运动联合控制

计算机视觉与模式识别 2026-05-08 v1 人工智能 机器学习

摘要

对于艺术应用而言,视频生成要求对表演和摄影(即演员的动作和摄像机轨迹)进行细粒度控制。我们提出了 ActCam,一种零样本视频生成方法,它将驱动视频中的角色动作转移到新场景中,并实现对摄像机内参与外参的逐帧控制。ActCam 可构建于任何接受场景深度和角色姿态条件预训练的图像到视频扩散模型之上。给定一段包含运动角色的源视频和目标摄像机运动,ActCam 会生成在帧间保持几何一致的姿态和深度条件。随后,我们运行带有两阶段条件调度的一次采样过程:早期去噪步骤同时基于姿态和稀疏深度进行条件化以强化场景结构;此后舍弃深度,仅使用姿态引导来细化高频细节,而不会对生成过程造成过度约束。我们在涵盖多种角色动作和极具挑战性的视角变化的多个基准上对 ActCam 进行了评估。我们发现,与仅使用姿态控制以及其他结合姿态与摄像机的方法相比,ActCam 提升了摄像机依从性和动作保真度,并在人类评估中更受青睐,尤其是在视角大幅变化的情况下。我们的结果强调,精心设计的摄像机一致性条件化与分阶段引导能够在无需训练的情况下实现强大的摄像机与运动联合控制。项目页面:https://elkhomar.github.io/actcam/。

关键词

引用

@article{arxiv.2605.06667,
  title  = {ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation},
  author = {Omar El Khalifi and Thomas Rossi and Oscar Fossey and Thibault Fouque and Ulysse Mizrahi and Philip Torr and Ivan Laptev and Fabio Pizzati and Baptiste Bellot-Gurlet},
  journal= {arXiv preprint arXiv:2605.06667},
  year   = {2026}
}

备注

SIGGRAPH 2026