生成式全景图:学习将视频分解为图层
计算机视觉与模式识别
2025-03-25 v2
摘要
给定视频和一组输入对象掩码,全景图方法旨在将视频分解为包含单个对象及其相关效果(如阴影和反射)的语义上有意义的图层。现有的全景图方法假设场景静止或准确的姿态和深度估计,当这些假设被违反时会产生较差的分解结果。此外,由于缺乏对自然视频的生成先验,现有方法无法完成动态遮挡区域。我们提出了一种新型生成式分层视频分解框架,以解决全景图问题。我们的方法不假设场景静止,也无需相机姿态或深度信息,能够产生干净、完整的图层,包括对动态遮挡区域的令人信服的完成。我们的核心思想是训练一个视频扩散模型来识别和移除由特定对象引起的场景效果。我们展示了该模型可以从现有的视频填充模型进行微调,仅需小而精心挑选的数据集,即可实现高质量的分解和编辑结果,适用于广泛的日常拍摄视频,包含柔和阴影、光泽反射、水花溅起等多种效果。
引用
@article{arxiv.2411.16683,
title = {Generative Omnimatte: Learning to Decompose Video into Layers},
author = {Yao-Chih Lee and Erika Lu and Sarah Rumbley and Michal Geyer and Jia-Bin Huang and Tali Dekel and Forrester Cole},
journal= {arXiv preprint arXiv:2411.16683},
year = {2025}
}
备注
CVPR 2025. Project page: https://gen-omnimatte.github.io/