中文

LoRA3D:三维几何基础模型的低秩自校准

计算机视觉与模式识别 2024-12-11 v1 机器学习 机器人学

摘要

新兴的三维几何基础模型,如 DUSt3R,为自然场景下的三维视觉任务提供了一种有前景的方法。然而,由于问题空间的高维性和高质量三维数据的稀缺,这些预训练模型在许多具有挑战性的情况下仍然难以泛化,例如视角重叠有限或低光照条件。为了解决这个问题,我们提出了 LoRA3D,这是一种高效的自校准流程,旨在利用目标场景自身的多视图预测来 特化\textit{特化} 预训练模型。以稀疏的 RGB 图像作为输入,我们利用鲁棒优化技术来优化多视图预测,并将它们对齐到一个全局坐标系中。特别地,我们将预测置信度纳入几何优化过程,自动重新加权置信度以更好地反映点估计的准确性。我们使用校准后的置信度为校准视图生成高质量的伪标签,并使用低秩自适应 (LoRA) 在伪标签数据上微调模型。我们的方法不需要任何外部先验或人工标签。它能在 单个标准 GPU 上仅用 5 分钟\textbf{单个标准 GPU 上仅用 5 分钟} 完成自校准过程。每个低秩适配器仅需 18MB\textbf{18MB} 的存储空间。我们在 Replica、TUM 和 Waymo Open 数据集的 超过 160 个场景\textbf{超过 160 个场景} 上评估了我们的方法,在三维重建、多视图位姿估计和新视角合成方面实现了高达 \textbf{88% 的性能提升}

关键词

引用

@article{arxiv.2412.07746,
  title  = {LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models},
  author = {Ziqi Lu and Heng Yang and Danfei Xu and Boyi Li and Boris Ivanovic and Marco Pavone and Yue Wang},
  journal= {arXiv preprint arXiv:2412.07746},
  year   = {2024}
}