中文

LeviTor:面向3D轨迹的图像到视频合成

计算机视觉与模式识别 2025-03-31 v2

摘要

拖拽式交互的直观特性导致其在图像到视频合成中控制物体轨迹方面获得了不断采纳。然而,现有方法在2D空间中进行拖拽,通常在处理超平面运动时面临歧义。在本工作中,我们增强了该交互方式,引入了新的维度,即深度维度,使得用户可以为轨迹上的每个点分配相对深度。这样,我们新的交互范式不仅继承了2D拖拽的便利性,还促进了在3D空间中进行轨迹控制,拓宽了创意的范围。我们提出了一种在图像到视频合成中进行3D轨迹控制的开创性方法,通过将物体掩码抽象为少数聚类点。这些点伴随深度信息和实例信息,最终作为控制信号输入到视频扩散模型中。大量实验验证了我们的方法——称为LeviTor——在生成来自静态图像的照片级视频时,精确操控物体运动方面的有效性。我们的代码可在 https://github.com/ant-research/LeviTor 获取。

关键词

引用

@article{arxiv.2412.15214,
  title  = {LeviTor: 3D Trajectory Oriented Image-to-Video Synthesis},
  author = {Hanlin Wang and Hao Ouyang and Qiuyu Wang and Wen Wang and Ka Leong Cheng and Qifeng Chen and Yujun Shen and Limin Wang},
  journal= {arXiv preprint arXiv:2412.15214},
  year   = {2025}
}

备注

Project page available at https://github.com/ant-research/LeviTor