中文

tttLRM:用于长上下文和自回归 3D 重建的测试时训练

计算机视觉与模式识别 2026-03-03 v2

摘要

我们提出 tttLRM—a 一个新型大规模 3D 重建模型,利用测试时训练(TTT)层实现长上下文、自回归 3D 重建,具有线性计算复杂度,进一步扩展模型能力。我们的框架高效地将多个图像观察压缩到 TTT 层的快速权重中,在潜在空间中形成隐式 3D 表示,可解码为各种显式格式,如用于下游应用的高斯溅射(GS)。我们的模型的在线学习变体支持从流式观察进行渐进式 3D 重建和细化。我们展示了在新视角合成任务上的预训练有效地转化为显式 3D 建模,实现重建质量的提升和更快的收敛。广泛的实验表明,我们的方法在对象和场景上的前馈 3D 高斯重建中实现卓越性能,优于现有的先进方法。

关键词

引用

@article{arxiv.2602.20160,
  title  = {tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction},
  author = {Chen Wang and Hao Tan and Wang Yifan and Zhiqin Chen and Yuheng Liu and Kalyan Sunkavalli and Sai Bi and Lingjie Liu and Yiwei Hu},
  journal= {arXiv preprint arXiv:2602.20160},
  year   = {2026}
}

备注

Accepted by CVPR 2026. Project Page: https://cwchenwang.github.io/tttLRM