中文

YoNoSplat:仅需一个模型即可实现前馈3D高斯溅写

计算机视觉与模式识别 2025-11-11 v1

摘要

从非结构化图像集合重建快速灵活的3D场景仍是重大挑战。我们提出YoNoSplat,一种从任意数量图像重建高质量3D高斯溅写表示的前馈模型。该模型非常灵活,能够有效处理带姿态和无姿态、已标定和未标定的输入。YoNoSplat为每个视角预测局部高斯和相机姿态,这些姿态通过预测或提供的姿态聚合为全局表示。为克服同时学习3D高斯和相机参数的内在困难,我们引入一种新颖的混合训练策略。该方法通过初始使用真实姿态聚合局部高斯,逐渐过渡到预测和真实姿态的混合,从而防止训练不稳定和暴露偏差。我们通过一种新颖的两两相机距离归一化方案以及嵌入相机内参来解决尺度歧义问题。此外,YoNoSplat还预测内在参数,使其适用于未标定输入。YoNoSplat在NVIDIA GH200 GPU上仅用2.69秒即可从100个视角(280x518分辨率)重建场景,实现了在姿态自由和姿态依赖设置中的最先进性能。我们的项目页面位于https://botaoye.github.io/yonosplat/。

关键词

引用

@article{arxiv.2511.07321,
  title  = {YoNoSplat: You Only Need One Model for Feedforward 3D Gaussian Splatting},
  author = {Botao Ye and Boqi Chen and Haofei Xu and Daniel Barath and Marc Pollefeys},
  journal= {arXiv preprint arXiv:2511.07321},
  year   = {2025}
}