预训练、自训练、蒸馏:超大规模三维重建的简易配方
计算机视觉与模式识别
2022-04-08 v1
摘要
我们的工作学习了一个统一模型,用于从数百个语义类别中进行单视图三维物体重建。作为直接三维监督的可扩展替代方案,我们的工作依赖于分割图像集合来学习通用类别的三维信息。与使用类似监督但从头学习独立类别特定模型的先前工作不同,我们学习统一模型的方法简化了训练过程,同时使模型能够受益于跨类别的共同结构。利用标准识别数据集中的图像集合,我们展示了该方法能够学习超过 150 个物体类别的三维推理。我们使用两个数据集进行评估,并定性和定量地表明,我们的统一重建方法优于先前的类别特定重建基线。我们最终的三维重建模型还能够对未见过的物体类别图像进行零样本推理,并且我们通过实验证明,增加训练类别的数量可以提高重建质量。
引用
@article{arxiv.2204.03642,
title = {Pre-train, Self-train, Distill: A simple recipe for Supersizing 3D Reconstruction},
author = {Kalyan Vasudev Alwala and Abhinav Gupta and Shubham Tulsiani},
journal= {arXiv preprint arXiv:2204.03642},
year = {2022}
}
备注
To appear in CVPR 22. Project page: https://shubhtuls.github.io/ss3d/