中文

多视角金字塔Transformer:广视野深入观察

计算机视觉与模式识别 2025-12-09 v1

摘要

我们提出多视角金字塔Transformer(Multi-view Pyramid Transformer, MVP),一个可扩展的多视角Transformer架构,直接在单次前向传播中从十几至上百张图像重建大规模3D场景。借助“广视野看全局,细节看局部”的思想,MVP建立在两个核心设计原则之上:1) 局部到全局的视角层级结构,逐步拓宽模型视角从局部视角到群体最终整个场景,以及2) 细到粗的视内层级结构,从详细的空间表示开始,逐步聚合为紧凑且信息密集的标记。这种双层级结构实现了计算效率与表示丰富性,使大规模复杂场景的快速重建成为可能。我们在多样化数据集上验证了MVP,并展示了它与3D高斯溅写作为底层3D表示时,在广泛的视角配置下,实现了最先进的可泛化重建质量,同时保持高效和可扩展性。

关键词

引用

@article{arxiv.2512.07806,
  title  = {Multi-view Pyramid Transformer: Look Coarser to See Broader},
  author = {Gyeongjin Kang and Seungkwon Yang and Seungtae Nam and Younggeun Lee and Jungwoo Kim and Eunbyung Park},
  journal= {arXiv preprint arXiv:2512.07806},
  year   = {2025}
}

备注

Project page: see https://gynjn.github.io/MVP/