中文

STream3R:基于因果 Transformer 的可扩展顺序 3D 重建

计算机视觉与模式识别 2025-08-15 v1

摘要

我们提出了 STream3R,这是一种新颖的 3D 重建方法,将点图预测重新表述为解码器-only Transformer 问题。现有多视角重建的前沿方法要么依赖昂贵的全局优化,要么依赖简单易记的内存机制,随序列长度而扩展性能差。相比之下,STream3R 引入了一种高效处理图像序列的流式框架,利用因果注意力机制,受现代语言模型进展的启发。通过从大规模 3D 数据集中学习几何先验,STream3R 能良好地泛化到包括传统方法常失败的动态场景在内的多样且具挑战性的场景。大量实验表明,我们的方法在静态和动态场景基准测试中均显著优于先前工作。此外,STream3R 本身与 LLM 风格的训练基础设施兼容,支持高效的大规模预训练和微调,以适应各种下游 3D 任务。我们的结果凸显了因果 Transformer 模型用于在线 3D 感知的潜力,为在流式环境中实现实时 3D 理解铺平了道路。更多细节请参见我们的项目页面:https://nirvanalan.github.io/projects/stream3r。

关键词

引用

@article{arxiv.2508.10893,
  title  = {STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer},
  author = {Yushi Lan and Yihang Luo and Fangzhou Hong and Shangchen Zhou and Honghua Chen and Zhaoyang Lyu and Shuai Yang and Bo Dai and Chen Change Loy and Xingang Pan},
  journal= {arXiv preprint arXiv:2508.10893},
  year   = {2025}
}

备注

TL;DR: Streaming 4D reconstruction using causal transformer. Project page: https://nirvanalan.github.io/projects/stream3r