中文

GEN3C:基于3D信息的世界一致性视频生成与精确相机控制

计算机视觉与模式识别 2025-03-06 v1 图形学

摘要

我们提出了GEN3C模型,具备精确的相机控制能力和时序3D一致性。虽然先前的视频模型已能生成逼真的视频,但它们倾向于很少利用3D信息,导致诸如物体出现与消失不一致等问题。相机控制若有实现,也是不精确的,因为相机参数仅作为神经网络的输入,模型又必须推断视频如何依赖于相机。相比之下,GEN3C由3D缓存(通过预测种子图像或先前生成帧的像素级深度获得的点云)所指导。在生成后续帧时,GEN3C以新的相机轨迹为用户提供条件,基于3D缓存的2D渲染进行条件化。关键在于,GEN3C无需记忆其先前生成的内容,也无需从相机位姿推断图像结构。模型可以将所有生成能力集中于尚未观察到的区域,以及推进场景状态至下一帧。我们的实验结果表明,GEN3C在稀疏视图新视图合成方面达到最前沿的成绩,包括驾驶场景和单目动态视频等具有挑战性的情形。结果最佳呈现于视频形式。欢迎访问我们的网页!https://research.nvidia.com/labs/toronto-ai/GEN3C/

关键词

引用

@article{arxiv.2503.03751,
  title  = {GEN3C: 3D-Informed World-Consistent Video Generation with Precise Camera Control},
  author = {Xuanchi Ren and Tianchang Shen and Jiahui Huang and Huan Ling and Yifan Lu and Merlin Nimier-David and Thomas Müller and Alexander Keller and Sanja Fidler and Jun Gao},
  journal= {arXiv preprint arXiv:2503.03751},
  year   = {2025}
}

备注

To appear in CVPR 2025. Website: https://research.nvidia.com/labs/toronto-ai/GEN3C/