3DTrajMaster:在视频生成中掌控多实体运动的三维轨迹
计算机视觉与模式识别
2025-07-08 v3
摘要
本文旨在操控视频生成中的多实体三维运动。以往的可控视频生成方法主要利用二维控制信号来操控物体运动,并取得了显著的合成效果。然而,二维控制信号在表达物体运动的三维本质方面存在固有限制。为克服此问题,我们引入了3DTrajMaster,这是一个鲁棒的控制器,能够根据用户指定的实体六自由度位姿(位置和旋转)序列,在三维空间中调控多实体动态。我们方法的核心是一个即插即用的、基于三维运动的物体注入器,它通过门控自注意力机制将多个输入实体与其各自的三维轨迹融合。此外,我们利用一种注入器架构来保留视频扩散先验,这对泛化能力至关重要。为减轻视频质量下降,我们在训练期间引入域适配器,并在推理期间采用退火采样策略。为解决缺乏合适训练数据的问题,我们构建了一个360-Motion数据集,该数据集首先将收集到的三维人类和动物资产与GPT生成的轨迹相关联,然后在多样化的三维虚幻引擎平台上用12个均匀环绕的摄像机捕捉其运动。大量实验表明,3DTrajMaster在控制多实体三维运动的准确性和泛化能力方面均达到了新的最优水平。项目页面:http://fuxiao0719.github.io/projects/3dtrajmaster
引用
@article{arxiv.2412.07759,
title = {3DTrajMaster: Mastering 3D Trajectory for Multi-Entity Motion in Video Generation},
author = {Xiao Fu and Xian Liu and Xintao Wang and Sida Peng and Menghan Xia and Xiaoyu Shi and Ziyang Yuan and Pengfei Wan and Di Zhang and Dahua Lin},
journal= {arXiv preprint arXiv:2412.07759},
year = {2025}
}
备注
ICLR 2025. Project Page & Code & Data: http://fuxiao0719.github.io/projects/3dtrajmaster