中文

VideoHandles:使用视频生成先验编辑视频中的 3D 物体组成

计算机视觉与模式识别 2025-03-28 v2

摘要

图像和视频编辑的生成方法使用生成模型作为先验,尽管信息不完整(例如更改显示在单张图像中的 3D 物体组成),仍可进行编辑。近期方法在图像设置下显示出有前景的组成编辑结果,但在视频设置下,编辑方法仅聚焦于编辑物体的外观和运动,或相机运动,因而缺乏针对视频中物体组成编辑的方法。我们提出了 \name 作为一种编辑静态场景中带有相机运动的视频中 3D 物体组成的方法。我们的 approach 允许在视频的所有帧中对 3D 物体的位置进行一致的编辑。通过将生成模型的中间特征提升到在所有帧之间共享的 3D 重建中,对重建进行编辑,然后将编辑后的特征投影回到每一帧来实现这一点。迄今为止,这是首个用于编辑视频中物体组成的生成方法。我们的 method 简单且无需训练,同时优于基于图像编辑的前沿方法。

关键词

引用

@article{arxiv.2503.01107,
  title  = {VideoHandles: Editing 3D Object Compositions in Videos Using Video Generative Priors},
  author = {Juil Koo and Paul Guerrero and Chun-Hao Paul Huang and Duygu Ceylan and Minhyuk Sung},
  journal= {arXiv preprint arXiv:2503.01107},
  year   = {2025}
}

备注

Project page: https://videohandles.github.io