中文

CUBE360:面向虚拟现实的单目360度深度估计的立方体场表示学习

计算机视觉与模式识别 2024-10-10 v1

摘要

全景图像提供了全面的场景信息,适用于虚拟现实应用。获取相应的深度图对于实现沉浸式和交互式体验至关重要。然而,由于等距柱状投影造成的严重畸变以及全景RGB-D数据集的有限可用性,全景深度估计面临重大挑战。受神经渲染近期成功的启发,我们提出了一种名为CUBE360\mathbf{CUBE360}的新方法,该方法从单张全景图像中学习由多个MPI组成的立方体场,用于任意视角方向的连续\mathbf{连续}深度估计。我们的CUBE360采用立方体贴图投影将ERP图像转换为六个面,并为每个面提取MPI,从而减少了高分辨率数据MPI处理所需的内存消耗。此外,这种方法避免了处理等距柱状投影固有的不均匀像素分布的计算复杂性。然后采用基于注意力的融合模块来学习立方体面MPI之间的相关性,构建一个包含不同深度层次颜色和密度信息的立方体场表示。此外,引入了一种新颖的采样策略,用于在立方体和平面尺度上从立方体场渲染新视角。整个流程使用自监督学习方法,通过从渲染视图计算光度损失进行训练,使得无需深度标注即可在360度视频上进行训练。在合成和真实数据集上的实验表明,与之前的自监督学习方法相比,CUBE360具有优越的性能。我们还强调了其在下游应用中的有效性,例如VR漫游和视觉效果,突出了CUBE360增强沉浸式体验的潜力。

关键词

引用

@article{arxiv.2410.05735,
  title  = {CUBE360: Learning Cubic Field Representation for Monocular 360 Depth Estimation for Virtual Reality},
  author = {Wenjie Chang and Hao Ai and Tianzhu Zhang and Lin Wang},
  journal= {arXiv preprint arXiv:2410.05735},
  year   = {2024}
}