中文

面向单目视频实时三维视觉感知的跨维度精炼学习

计算机视觉与模式识别 2023-09-12 v2 图像与视频处理

摘要

我们提出一种新颖的实时可行学习方法,联合感知三维场景的几何结构与语义标签。近期实时三维场景重建方法多采用体素方案,直接回归截断符号距离函数 (TSDF)。然而,这些体素方法倾向于关注重建的全局一致性,导致缺乏局部几何细节。为克服该问题,我们提出通过显式深度预测与锚定特征生成来利用二维图像特征中的潜在几何先验知识,以精炼 TSDF 体素中的占据学习。此外,我们发现这种跨维度特征精炼方法也可通过利用语义先验用于语义分割任务。因此,我们提出端到端跨维度精炼神经网络 (CDRNet),实时提取三维网格与三维语义标注。实验结果表明,该方法在多个数据集上实现了当前最优 (SOTA) 的三维感知效率,显示出我们的方法在工业应用中的巨大潜力。

关键词

引用

@article{arxiv.2303.09248,
  title  = {Cross-Dimensional Refined Learning for Real-Time 3D Visual Perception from Monocular Video},
  author = {Ziyang Hong and C. Patrick Yue},
  journal= {arXiv preprint arXiv:2303.09248},
  year   = {2023}
}

备注

Accpeted to ICCV 2023 Workshops. Project page: https://hafred.github.io/cdrnet/