基于空间记忆的 3D 重建
计算机视觉与模式识别
2024-08-30 v1
摘要
我们提出了 Spann3R,这是一种用于从有序或无序图像集合进行稠密 3D 重建的新方法。基于 DUSt3R 框架,Spann3R 使用基于转换器的架构直接从图像中回归点图,而无需场景或相机参数的先验知识。与 DUSt3R 不同,后者预测每个图像对的点图并以其局部坐标系表示,而 Spann3R 能预测以全局坐标系表示的每个图像的点图,从而消除对基于优化的全局对齐的需求。Spann3R 的关键思想是管理一个外部空间记忆,用于学习跟踪所有先前相关的 3D 信息。Spann3R 然后查询此空间记忆,以在全局坐标系中预测下一帧的 3D 结构。利用 DUSt3R 的预训练权重,并进一步在数据集子集上微调,Spann3R 在各种不可见数据集上表现出竞争性能和良好的泛化能力,并且可以实时处理有序图像集合。项目页面: \url{https://hengyiwang.github.io/projects/spanner}
引用
@article{arxiv.2408.16061,
title = {3D Reconstruction with Spatial Memory},
author = {Hengyi Wang and Lourdes Agapito},
journal= {arXiv preprint arXiv:2408.16061},
year = {2024}
}
备注
Project page: \url{https://hengyiwang.github.io/projects/spanner}