中文

用于三维重建的多视图压缩编码

计算机视觉与模式识别 2023-01-20 v1

摘要

视觉识别的一个核心目标是从单张图像理解物体与场景。得益于大规模学习和通用表征,二维识别已取得巨大进展。相比之下,三维带来了源于图像中未描绘的遮挡的新挑战。先前工作试图通过多视图推断来克服这些问题,或依赖稀缺的CAD模型和类别特定先验,这阻碍了向新场景的扩展。在本工作中,我们受自监督学习进展的启发,通过学习的可泛化表征来探索单视图三维重建。我们引入了一个简单框架,该框架处理单个物体或整个场景的三维点,并结合来自多样化RGB-D视频的类别无关大规模训练。我们的模型多视图压缩编码(Multiview Compressive Coding, MCC)学习压缩输入的表观与几何,通过查询三维感知解码器来预测三维结构。MCC的通用性与高效性使其能够从大规模多样数据源中学习,并对DALL\cdotE 2所想象的新物体或用iPhone在野外捕获的物体具有强泛化能力。

关键词

引用

@article{arxiv.2301.08247,
  title  = {Multiview Compressive Coding for 3D Reconstruction},
  author = {Chao-Yuan Wu and Justin Johnson and Jitendra Malik and Christoph Feichtenhofer and Georgia Gkioxari},
  journal= {arXiv preprint arXiv:2301.08247},
  year   = {2023}
}

备注

Project page: https://mcc3d.github.io/