LoRA3D:三维几何基础模型的低秩自校准
计算机视觉与模式识别
2024-12-11 v1 机器学习
机器人学
摘要
新兴的三维几何基础模型,如 DUSt3R,为自然场景下的三维视觉任务提供了一种有前景的方法。然而,由于问题空间的高维性和高质量三维数据的稀缺,这些预训练模型在许多具有挑战性的情况下仍然难以泛化,例如视角重叠有限或低光照条件。为了解决这个问题,我们提出了 LoRA3D,这是一种高效的自校准流程,旨在利用目标场景自身的多视图预测来 预训练模型。以稀疏的 RGB 图像作为输入,我们利用鲁棒优化技术来优化多视图预测,并将它们对齐到一个全局坐标系中。特别地,我们将预测置信度纳入几何优化过程,自动重新加权置信度以更好地反映点估计的准确性。我们使用校准后的置信度为校准视图生成高质量的伪标签,并使用低秩自适应 (LoRA) 在伪标签数据上微调模型。我们的方法不需要任何外部先验或人工标签。它能在 完成自校准过程。每个低秩适配器仅需 的存储空间。我们在 Replica、TUM 和 Waymo Open 数据集的 上评估了我们的方法,在三维重建、多视图位姿估计和新视角合成方面实现了高达 \textbf{88% 的性能提升}。
引用
@article{arxiv.2412.07746,
title = {LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models},
author = {Ziqi Lu and Heng Yang and Danfei Xu and Boyi Li and Boris Ivanovic and Marco Pavone and Yue Wang},
journal= {arXiv preprint arXiv:2412.07746},
year = {2024}
}