Pix2Vox:基于上下文感知的单视图与多视图图像三维重建
计算机视觉与模式识别
2020-06-02 v2
摘要
过去几年中,通过深度神经网络从单视图或多视图 RGB 图像恢复物体的三维表示引起了越来越多的关注。若干主流工作(如 3D-R2N2)使用循环神经网络(RNNs)按顺序融合从输入图像提取的多个特征图。然而,当给定相同的一组输入图像但顺序不同时,基于 RNN 的方法无法产生一致的重建结果。此外,由于长期记忆丢失,RNN 无法充分利用输入图像来优化重建结果。为解决这些问题,我们提出了一种用于单视图和多视图三维重建的新框架,名为 Pix2Vox。通过使用精心设计的编码器-解码器,它从每张输入图像生成粗糙的三维体素。然后,引入上下文感知融合模块,从不同粗糙三维体素中自适应地为每个部分(如桌腿)选择高质量重建,以获得融合的三维体素。最后,一个细化器进一步细化融合的三维体素以生成最终输出。在 ShapeNet 和 Pix3D 基准上的实验结果表明,所提出的 Pix2Vox 大幅优于最先进方法。此外,所提方法在反向推理时间上比 3D-R2N2 快 24 倍。在 ShapeNet 未见三维类别上的实验显示了我们方法的优越泛化能力。
引用
@article{arxiv.1901.11153,
title = {Pix2Vox: Context-aware 3D Reconstruction from Single and Multi-view Images},
author = {Haozhe Xie and Hongxun Yao and Xiaoshuai Sun and Shangchen Zhou and Shengping Zhang},
journal= {arXiv preprint arXiv:1901.11153},
year = {2020}
}
备注
ICCV 2019