中文

基于分层神经表示的可编辑自由视点视频

计算机视觉与模式识别 2021-05-03 v1 图形学

摘要

生成自由视点视频对于沉浸式 VR/AR 体验至关重要,但近期的神经方法仍缺乏对大型动态场景视觉感知进行操控的编辑能力。为填补这一空白,本文提出首个针对大规模动态场景、仅使用稀疏 16 个相机即可生成可编辑照片级真实自由视点视频的方法。我们方法的核心是一种新的分层神经表示,其中每个动态实体(包括环境本身)都被建模为一个称为 ST-NeRF 的时空连贯神经分层辐射表示。这种分层表示支持对动态场景进行完全的感知与真实操控,同时仍支持在宽广范围内的自由观看体验。在我们的 ST-NeRF 中,动态实体/层被表示为连续函数,以连续且自监督的方式实现了动态实体的位置、形变以及外观的解耦。我们提出场景解析 4D 标签图跟踪以显式解耦空间信息,并提出连续形变模块以隐式解耦时间运动。进一步引入物体感知体渲染方案用于所有神经层的重新组装。我们采用一种新颖的分层损失和运动感知光线采样策略,以实现对含多个表演者的大型动态场景的高效训练。我们的框架进一步支持多种编辑功能,即操控单个神经层的尺度和位置、复制或重定时以创造大量视觉效果,同时保持高真实感。大量实验证明了我们的方法在动态场景高质量、照片级真实且可编辑的自由视点视频生成上的有效性。

关键词

引用

@article{arxiv.2104.14786,
  title  = {Editable Free-viewpoint Video Using a Layered Neural Representation},
  author = {Jiakai Zhang and Xinhang Liu and Xinyi Ye and Fuqiang Zhao and Yanshun Zhang and Minye Wu and Yingliang Zhang and Lan Xu and Jingyi Yu},
  journal= {arXiv preprint arXiv:2104.14786},
  year   = {2021}
}