中文

MotionCanvas:基于可控图像到视频生成的电影镜头设计

计算机视觉与模式识别 2025-02-07 v1

摘要

本文提出一种允许用户在图像到视频生成背景下设计电影视频镜头的方法。镜头设计是电影制作的关键环节,涉及精心规划场景中的摄像机运动和物体运动。然而,在现代图像到视频生成系统中实现直观的镜头设计面临两个主要挑战:第一,有效捕捉用户在运动设计上的意图,其中摄像机运动和场景空间中的物体运动必须同时指定;第二,表示能够被视频扩散模型有效利用以合成图像动画的运动信息。为应对这些挑战,我们引入 MotionCanvas,一种将用户驱动控制集成到图像到视频(I2V)生成模型中的方法,允许用户以场景感知的方式同时控制物体和摄像机运动。通过连接经典计算机图形学与当代视频生成技术的洞见,我们展示了在无需昂贵 3D 相关训练数据的情况下,在 I2V 合成中实现 3D 感知运动控制的能力。MotionCanvas 使用户能够直观地描绘场景空间运动意图,并将其转化为视频扩散模型的时空运动条件信号。我们在广泛的真实世界图像内容和镜头设计场景上展示了该方法的有效性,突显了其在增强数字内容创作创意工作流程以及适应各种图像和视频编辑应用方面的潜力。

关键词

引用

@article{arxiv.2502.04299,
  title  = {MotionCanvas: Cinematic Shot Design with Controllable Image-to-Video Generation},
  author = {Jinbo Xing and Long Mai and Cusuh Ham and Jiahui Huang and Aniruddha Mahapatra and Chi-Wing Fu and Tien-Tsin Wong and Feng Liu},
  journal= {arXiv preprint arXiv:2502.04299},
  year   = {2025}
}

备注

It is best viewed in Acrobat. Project page: https://motion-canvas25.github.io/