中文

用于一致视频编辑的分层神经图集

计算机视觉与模式识别 2021-09-24 v1 图形学

摘要

我们提出一种将输入视频分解或“展开”为一组分层2D图集的方法,每个图集提供视频中物体(或背景)外观的统一表示。对于视频中的每个像素,我们的方法估计其在每个图集中的对应2D坐标,给出视频的一致参数化,以及相关的alpha(不透明度)值。重要的是,我们将图集设计为可解释且语义化的,从而在图集域中促进轻松直观的编辑,所需手工工作最少。应用于单个2D图集(或输入视频帧)的编辑会自动且一致地映射回原始视频帧,同时保留遮挡、形变及其他复杂场景效果如阴影和反射。我们的方法采用基于坐标的多层感知机(MLP)表示用于映射、图集和alpha,它们在每个视频基础上联合优化,使用视频重建和正则化损失的组合。通过纯粹在2D中操作,我们的方法不需要任何关于场景几何或相机位姿的先验3D知识,并能处理复杂的动态真实世界视频。我们展示了各种视频编辑应用,包括纹理映射、视频风格迁移、图像到视频纹理迁移以及分割/标签传播,所有这些都通过编辑单个2D图集图像自动生成。

关键词

引用

@article{arxiv.2109.11418,
  title  = {Layered Neural Atlases for Consistent Video Editing},
  author = {Yoni Kasten and Dolev Ofri and Oliver Wang and Tali Dekel},
  journal= {arXiv preprint arXiv:2109.11418},
  year   = {2021}
}