中文

Pix2Vox++:基于单幅与多幅图像的多尺度上下文感知三维物体重建

计算机视觉与模式识别 2020-10-06 v2

摘要

利用深度神经网络从单幅或多幅图像恢复物体的三维形状在过去几年中引起了越来越多的关注。主流工作(如 3D-R2N2)使用循环神经网络(RNNs)顺序融合输入图像的特征图。然而,基于 RNN 的方法在给定相同输入图像但顺序不同时,无法产生一致的重建结果。此外,RNN 可能因长期记忆丢失而遗忘早期输入图像的重要特征。为解决这些问题,我们提出了一种用于单视图和多视图三维物体重建的新框架,名为 Pix2Vox++。通过使用精心设计的编码器-解码器,它从每幅输入图像生成粗粒度三维体。随后引入多尺度上下文感知融合模块,从不同部分的全部粗粒度三维体中自适应选择高质量重建结果,以获得融合的三维体。为进一步纠正融合三维体中错误恢复的部分,采用细化器生成最终输出。在 ShapeNet、Pix3D 和 Things3D 基准上的实验结果表明,Pix2Vox++ 在准确性和效率方面均优于最先进的方法。

关键词

引用

@article{arxiv.2006.12250,
  title  = {Pix2Vox++: Multi-scale Context-aware 3D Object Reconstruction from Single and Multiple Images},
  author = {Haozhe Xie and Hongxun Yao and Shengping Zhang and Shangchen Zhou and Wenxiu Sun},
  journal= {arXiv preprint arXiv:2006.12250},
  year   = {2020}
}

备注

International Journal of Computer Vision (IJCV). arXiv admin note: text overlap with arXiv:1901.11153