中文

LVT:基于局部视角Transformer的大规模场景重建

计算机视觉与模式识别 2025-09-30 v1 机器学习

摘要

大型Transformer模型正在成为3D视觉和新视角合成的强大工具。然而,标准Transformer众所周知的二次复杂度使得这些方法难以扩展到大型场景。为了应对这一挑战,我们提出了局部视角Transformer(LVT),这是一种大规模场景重建和新视角合成架构,它规避了对二次注意力操作的需求。基于空间上邻近的视角比远处视角提供更多关于局部场景组成的有用信号这一见解,我们的模型在每个视角周围的局部邻域内处理所有信息。为了关注邻近视角中的token,我们利用了一种新颖的位置编码,该编码以查询视角与邻近视角之间的相对几何变换为条件。我们将模型的输出解码为3D Gaussian Splat场景表示,其中包含颜色和依赖于视角的不透明度。总而言之,局部视角Transformer能够在单次前向传播中重建任意大的高分辨率场景。有关结果和交互式演示,请参见我们的项目页面 https://toobaimt.github.io/lvt/。

关键词

引用

@article{arxiv.2509.25001,
  title  = {LVT: Large-Scale Scene Reconstruction via Local View Transformers},
  author = {Tooba Imtiaz and Lucy Chai and Kathryn Heal and Xuan Luo and Jungyeon Park and Jennifer Dy and John Flynn},
  journal= {arXiv preprint arXiv:2509.25001},
  year   = {2025}
}

备注

SIGGRAPH Asia 2025 camera-ready version; project page https://toobaimt.github.io/lvt/