中文

魔法修补:通过观察动态视频简化照片编辑

计算机视觉与模式识别 2025-08-08 v2

摘要

我们提出了一个生成模型,该模型给定粗糙编辑的图像,合成遵循指定布局的照片实况输出。该方法从原始图像传递细节,同时保留其部分身份。然而,它适应由新布局定义的光照和上下文。我们的关键洞察是,视频是获取监督信息的强大来源:物体和相机运动提供了许多关于世界如何随视角、光照和物理交互变化的观察。我们构建了一个图像数据集,其中每个样本是从同一视频中在随机选择的时间间隔内提取的源帧和目标帧的配对。我们使用两种运动模型将源帧扭曲以接近目标,以模拟预期的测试时间用户编辑。我们监督模型将扭曲图像翻译为ground truth,从预训练的扩散模型开始。我们的模型设计明确地使模型能够从源帧传递细节到生成的图像中,同时紧密遵循用户指定的布局。我们展示,通过使用简单的分割和粗糙2D操作,我们可以合成忠于用户输入的照片实况编辑,同时解决二阶效应,例如协调光照和编辑对象之间的物理交互。

关键词

引用

@article{arxiv.2403.13044,
  title  = {Magic Fixup: Streamlining Photo Editing by Watching Dynamic Videos},
  author = {Hadi Alzayer and Zhihao Xia and Xuaner Zhang and Eli Shechtman and Jia-Bin Huang and Michael Gharbi},
  journal= {arXiv preprint arXiv:2403.13044},
  year   = {2025}
}

备注

ACM Transactions on Graphics 2025. Project page: https://magic-fixup.github.io/