SpaceTimePilot:跨空间与时间的动态场景生成渲染
计算机视觉与模式识别
2026-01-01 v1 人工智能
机器人学
摘要
我们提出了 SpaceTimePilot,一个用于可控生成渲染的视频扩散模型,通过分离空间和时间实现可控性。给定单目视频,SpaceTimePilot 可在生成过程中独立地改变相机视点和运动序列,实现对空间和时间的连续且任意的探索。为实现此目标,我们引入了有效的动画时间嵌入机制,以显式控制输出视频的运动序列相对于源视频。由于没有数据集提供相同动态场景的连续时间变化配对视频,我们提出一种简单而有效的时序错位训练方案,将现有的多视角数据集改造以模拟时间差异。此策略有效监督模型学习时序控制,实现稳健的时空解耦。为进一步提升双重控制的精度,我们引入两个额外组件:改进的相机条件机制允许从第一帧改变相机,以及 CamxTime——首个提供场景内完全自由时空视频轨迹的合成时空全覆盖渲染数据集。在时序错位方案和 CamxTime 数据集上的联合训练导致更精确的时序控制。我们在真实数据和合成数据上对 SpaceTimePilot 进行评估,展示了清晰的时空解耦和优于先前工作的强大结果。项目页面:https://zheninghuang.github.io/Space-Time-Pilot/ 代码:https://github.com/ZheningHuang/spacetimepilot
引用
@article{arxiv.2512.25075,
title = {SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time},
author = {Zhening Huang and Hyeonho Jeong and Xuelin Chen and Yulia Gryaditskaya and Tuanfeng Y. Wang and Joan Lasenby and Chun-Hao Huang},
journal= {arXiv preprint arXiv:2512.25075},
year = {2026}
}
备注
Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot