Lite3R:一种模型无关的高效前馈3D重建框架
计算机视觉与模式识别
2026-05-13 v1
摘要
基于Transformer的3D重建已成为从多视角观测中恢复几何和外观的强大范式,在具有挑战性的视觉条件下展现出强大的性能。随着这些模型扩展到更大的骨干网络和更高分辨率的输入,提高其效率对于实际部署变得越来越重要。然而,现代3D Transformer管线面临两个耦合的挑战:密集的多视角注意力会产生大量的令牌混合开销,而低精度执行可能会破坏对几何敏感的表征,并降低深度、姿态和3D一致性。为了解决第一个挑战,我们提出了Lite3R,这是一个模型无关的教师-学生框架,它用稀疏线性注意力替换密集注意力,以保留重要的几何交互,同时降低注意力成本。为了解决第二个挑战,我们引入了一种参数高效的FP8感知量化感知训练(FP8-aware QAT)策略,并结合部分注意力蒸馏,该策略冻结了绝大多数预训练骨干参数,仅训练轻量级的线性分支投影层,从而在保留预训练几何先验的同时实现稳定的低精度部署。我们进一步在BlendedMVS和DTU64数据集上,对两个代表性骨干网络VGGT和DA3-Large评估了Lite3R,结果表明,它在保持整体有竞争力的重建质量的同时,显著降低了延迟(1.7-2.0倍)和内存使用(1.9-2.4倍)。这些结果表明,Lite3R为实用的基于Transformer的3D重建提供了一种有效的算法-系统协同设计方法。代码:https://github.com/AIGeeksGroup/Lite3R。网站:https://aigeeksgroup.github.io/Lite3R。
引用
@article{arxiv.2605.11354,
title = {Lite3R: A Model-Agnostic Framework for Efficient Feed-Forward 3D Reconstruction},
author = {Haoyu Zhang and Zeyu Zhang and Zedong Zhou and Yang Zhao and Hao Tang},
journal= {arXiv preprint arXiv:2605.11354},
year = {2026}
}