中文

ATI:用于可控视频生成的任意轨迹指令

计算机视觉与模式识别 2025-06-11 v3 人工智能

摘要

我们提出了一个用于视频生成中运动控制的统一框架,该框架使用基于轨迹的输入,无缝集成了摄像机移动、对象级平移和细粒度的局部运动。与以往通过独立模块或特定任务设计处理这些运动类型的方法不同,我们的方法通过轻量级运动注入器将用户定义的轨迹投影到预训练图生视频模型的潜在空间中,提供了一种连贯的解决方案。用户可以指定关键点及其运动路径,以控制局部变形、整体对象运动、虚拟摄像机动态或它们的组合。注入的轨迹信号引导生成过程产生时间一致且语义对齐的运动序列。我们的框架在多个视频运动控制任务中展现出卓越性能,包括风格化运动效果(如运动画笔)、动态视点变化和精确的局部运动操控。实验表明,与以往方法和商业解决方案相比,我们的方法提供了显著更好的可控性和视觉质量,同时与各种最先进的视频生成骨干网络保持广泛兼容。项目页面:https://anytraj.github.io/。

关键词

引用

@article{arxiv.2505.22944,
  title  = {ATI: Any Trajectory Instruction for Controllable Video Generation},
  author = {Angtian Wang and Haibin Huang and Jacob Zhiyuan Fang and Yiding Yang and Chongyang Ma},
  journal= {arXiv preprint arXiv:2505.22944},
  year   = {2025}
}