中文

面向快速多视图视频合成的混合神经体素

计算机视觉与模式识别 2023-10-10 v2

摘要

由于现实世界环境的复杂性和高度动态的运动,从真实世界多视图输入中合成高保真视频具有挑战性。以往基于神经辐射场的工作展示了动态场景的高质量重建。然而,在真实场景上训练此类模型非常耗时,通常需要数天或数周。在本文中,我们提出了一种名为 MixVoxels 的新方法,以更快的训练速度和有竞争力的渲染质量来更好地表示动态场景。所提出的 MixVoxels 将 4D 动态场景表示为静态和动态体素的混合,并使用不同的网络处理它们。这样,静态体素所需模态的计算可以由轻量级模型处理,这从根本上减少了计算量,特别是对于以静态背景为主的许多日常动态场景。为了分离这两种体素,我们提出了一种新颖的变化场来估计每个体素的时间方差。对于动态体素,我们设计了一种内积时间查询方法,以高效查询多个时间步,这对于恢复高动态运动至关重要。因此,对于输入为 300 帧视频的动态场景,MixVoxels 经过 15 分钟的训练即可获得比以往方法更好的 PSNR。代码和训练好的模型可在 https://github.com/fengres/mixvoxels 获取。

关键词

引用

@article{arxiv.2212.00190,
  title  = {Mixed Neural Voxels for Fast Multi-view Video Synthesis},
  author = {Feng Wang and Sinan Tan and Xinghang Li and Zeyue Tian and Yafei Song and Huaping Liu},
  journal= {arXiv preprint arXiv:2212.00190},
  year   = {2023}
}

备注

ICCV 2023 (Oral)