中文

PF-LRM:用于位姿与形状联合预测的无位姿大型重建模型

计算机视觉与模式识别 2023-11-27 v2

摘要

我们提出了一种无位姿大型重建模型(PF-LRM),用于从少量无位姿图像(即便视觉重叠很少)重建 3D 物体,同时在单块 A100 GPU 上约 1.3 秒内联合估计相对相机位姿。PF-LRM 是一种高度可扩展的方法,利用自注意力块在 3D 物体 token 与 2D 图像 token 之间交换信息;我们为每一视图预测一个粗点云,然后使用可微分的 Perspective-n-Point(PnP)求解器获取相机位姿。当在约 100 万物体的大量多视图位姿数据上训练时,PF-LRM 展现出强大的跨数据集泛化能力,并在多个未见评估数据集上的位姿预测精度和 3D 重建质量方面大幅优于基线方法。我们还展示了我们的模型在下游文本/图像到 3D 任务中通过快速前馈推理的适用性。我们的项目网站位于:https://totoro97.github.io/pf-lrm 。

关键词

引用

@article{arxiv.2311.12024,
  title  = {PF-LRM: Pose-Free Large Reconstruction Model for Joint Pose and Shape Prediction},
  author = {Peng Wang and Hao Tan and Sai Bi and Yinghao Xu and Fujun Luan and Kalyan Sunkavalli and Wenping Wang and Zexiang Xu and Kai Zhang},
  journal= {arXiv preprint arXiv:2311.12024},
  year   = {2023}
}

备注

Project website: https://totoro97.github.io/pf-lrm ; add more experiments