Speed3R:稀疏前馈 3D 重建模型
计算机视觉与模式识别
2026-03-10 v1 人工智能
摘要
虽然最近的前馈 3D 重建模型通过单次推断联合推断稠密几何与相机姿态来加速 3D 重建,但其对稠密注意力的依赖导致二次时间复杂度,从而严重限制了推理速度。为解决此问题,我们引入 Speed3R,这是一个受结构从运动核心原则启发的端到端可训练模型:即仅需一小部分关键点即可实现稳健的姿态估计。Speed3R 采用双分支注意力机制,其中压缩分支创建粗糙的上下文先验以引导选择分支,后者仅对最具信息性的图像标记执行精细注意力。该策略模仿了传统关键点匹配的效率,在 1000 视图序列上实现了惊人的 12.4 倍推理加速,同时仅在几何精度方面进行最小、受控的权衡。在 VGGT 和 backbone 上进行标准基准测试验证后,我们的方法在计算成本为原来的一小部分的情况下,交付了高质量的重建,为高效的大规模场景建模铺平了道路。
引用
@article{arxiv.2603.08055,
title = {Speed3R: Sparse Feed-forward 3D Reconstruction Models},
author = {Weining Ren and Xiao Tan and Kai Han},
journal= {arXiv preprint arXiv:2603.08055},
year = {2026}
}
备注
CVPR 2026 Findings, project page: https://visual-ai.github.io/speed3r/