中文

ForkNet:基于单张深度图像的多分支体素语义补全

计算机视觉与模式识别 2022-05-10 v1 人工智能 计算几何 机器学习 图像与视频处理

摘要

我们提出了一种从单张深度图像进行三维语义补全的新模型,该模型基于一个编码器与三个独立生成器,用于重建原始场景与补全场景的不同几何与语义表示,且全部共享同一潜在空间。为在网络几何分支与语义分支间传递信息,我们引入了在对应网络层拼接特征的分支路径。受真实场景训练样本数量有限的驱动,我们架构的一个有趣特性是能够通过生成包含遮挡与真实噪声的高质量、逼真新场景训练数据集来补充现有数据集。我们通过直接从潜在空间采样特征来构建新数据集,从而生成一对部分体素表面与补全体素语义表面。此外,我们利用多个判别器来提高重建的精度与真实感。我们在两个最常见补全任务的标准基准上展示了我们方法的优势:语义三维场景补全与三维物体补全。

关键词

引用

@article{arxiv.1909.01106,
  title  = {ForkNet: Multi-branch Volumetric Semantic Completion from a Single Depth Image},
  author = {Yida Wang and David Joseph Tan and Nassir Navab and Federico Tombari},
  journal= {arXiv preprint arXiv:1909.01106},
  year   = {2022}
}

备注

Accepted in International Conference on Computer Vision 2019