VideoHandles:使用视频生成先验编辑视频中的 3D 物体组成
计算机视觉与模式识别
2025-03-28 v2
摘要
图像和视频编辑的生成方法使用生成模型作为先验,尽管信息不完整(例如更改显示在单张图像中的 3D 物体组成),仍可进行编辑。近期方法在图像设置下显示出有前景的组成编辑结果,但在视频设置下,编辑方法仅聚焦于编辑物体的外观和运动,或相机运动,因而缺乏针对视频中物体组成编辑的方法。我们提出了 \name 作为一种编辑静态场景中带有相机运动的视频中 3D 物体组成的方法。我们的 approach 允许在视频的所有帧中对 3D 物体的位置进行一致的编辑。通过将生成模型的中间特征提升到在所有帧之间共享的 3D 重建中,对重建进行编辑,然后将编辑后的特征投影回到每一帧来实现这一点。迄今为止,这是首个用于编辑视频中物体组成的生成方法。我们的 method 简单且无需训练,同时优于基于图像编辑的前沿方法。
引用
@article{arxiv.2503.01107,
title = {VideoHandles: Editing 3D Object Compositions in Videos Using Video Generative Priors},
author = {Juil Koo and Paul Guerrero and Chun-Hao Paul Huang and Duygu Ceylan and Minhyuk Sung},
journal= {arXiv preprint arXiv:2503.01107},
year = {2025}
}
备注
Project page: https://videohandles.github.io