Uni3C:用于视频生成的统一3D增强摄像机与人类运动控制
计算机视觉与模式识别
2025-09-23 v2
摘要
摄像机和人类运动控制在视频生成中受到广泛关注,但现有方法通常分别处理,导致两方面数据缺乏高质量标注。为此,我们提出了Uni3C——一个统一的3D增强框架,用于精确控制视频生成中的摄像机和人类运动。Uni3C包含两个关键贡献:第一,我们提出了PCDController——一个使用冻结视频生成主干网络训练的即插即用控制模块,利用单目深度的未投影点云实现精准摄像机控制。通过利用点云的强3D先验和视频基础模型的强大能力,PCDController在推理主干网络是否冻结或微调时均表现出色的泛化能力。这种灵活性使Uni3C的不同模块能够在特定领域内分别训练(即摄像机控制或人类运动控制),减少对同时标注数据的依赖。第二,我们提出了用于推理阶段的联合对齐3D世界指导,无缝整合场景点云和SMPL-X角色,统一摄像机和人类运动的控制信号。大量实验表明,PCDController在驱动视频生成的微调主干网络进行摄像机运动控制时具有强大的鲁棒性。Uni3C在摄像机可控性和人类运动质量方面均显著优于竞争方法。此外,我们收集了包含挑战性摄像机运动和人类动作的针对性验证集,以验证方法有效性。
引用
@article{arxiv.2504.14899,
title = {Uni3C: Unifying Precisely 3D-Enhanced Camera and Human Motion Controls for Video Generation},
author = {Chenjie Cao and Jingkai Zhou and Shikai Li and Jingyun Liang and Chaohui Yu and Fan Wang and Xiangyang Xue and Yanwei Fu},
journal= {arXiv preprint arXiv:2504.14899},
year = {2025}
}
备注
Project page: https://github.com/ewrfcas/Uni3C. Accepted by Siggraph Asian 2025