中文

PoseTraj:视频扩散中位姿感知的轨迹控制

计算机视觉与模式识别 2025-03-21 v1

摘要

近期,轨迹引导的视频生成取得了显著进展。然而,由于 3D 理解能力有限,现有模型在生成大范围旋转下具有潜在 6D 位姿变化的物体运动时仍面临挑战。为解决此问题,我们引入 PoseTraj,一种位姿感知的视频拖拽模型,用于从二维轨迹生成 3D 对齐的运动。我们的方法采用新颖的两阶段位姿感知预训练框架,提升了模型在多样轨迹上的 3D 理解能力。具体而言,我们提出了大规模合成数据集 PoseTraj-10K,包含 1 万个物体遵循旋转轨迹的视频,并通过引入 3D 边界框作为中间监督信号,增强了模型对物体位姿变化的感知。随后,我们在真实世界视频上微调轨迹控制模块,并应用额外的相机解耦模块以进一步提升运动精度。在各种基准数据集上的实验表明,我们的方法不仅在旋转轨迹的 3D 位姿对齐拖拽方面表现出色,而且在轨迹精度和视频质量上也优于现有基线。

关键词

引用

@article{arxiv.2503.16068,
  title  = {PoseTraj: Pose-Aware Trajectory Control in Video Diffusion},
  author = {Longbin Ji and Lei Zhong and Pengfei Wei and Changjian Li},
  journal= {arXiv preprint arXiv:2503.16068},
  year   = {2025}
}

备注

Code, data and project page: https://robingg1.github.io/Pose-Traj/