用于流式3D重建的几何上下文转换器
计算机视觉与模式识别
2026-04-17 v2
摘要
流式3D重建旨在从视频流中恢复3D信息,如相机姿态和点云,这需要几何精度、时间一致性和计算效率。以SLAM原理为灵感,我们引入LingBot-Map,一个基于几何上下文转换器(GCT)架构的feed-forward 3D基础模型,用于从流式数据中重建场景。LingBot-Map的一个关键特征是其精心设计的注意力机制,将锚点上下文、姿态参考窗口和轨迹记忆整合,以分别解决坐标 grounding、稠密几何线索和长程漂移校正。这一设计保持了流式状态的紧凑性,同时保留丰富的几何上下文,使其能够在输入分辨率为518×378的长序列(超过10,000帧)上实现约20 FPS的稳定高效推理。广泛的评估表明,我们的方法在多种基准测试中优于现有的流式方法和迭代优化方法。
引用
@article{arxiv.2604.14141,
title = {Geometric Context Transformer for Streaming 3D Reconstruction},
author = {Lin-Zhuo Chen and Jian Gao and Yihang Chen and Ka Leong Cheng and Yipengjing Sun and Liangxiao Hu and Nan Xue and Xing Zhu and Yujun Shen and Yao Yao and Yinghao Xu},
journal= {arXiv preprint arXiv:2604.14141},
year = {2026}
}
备注
Project page: https://technology.robbyant.com/lingbot-map Code: https://github.com/robbyant/lingbot-map