4D-VGGT:用于动态场景几何估计的具时空感知通用基础模型
计算机视觉与模式识别
2025-11-25 v1
摘要
我们研究了动态场景几何估计这一具有挑战性的任务,这一任务需要表示空间和时间特征。通常,现有方法将这两种特征对齐到统一的潜在空间中来建模场景几何。然而,这种统一范式因空间和时间特征的异构性质而存在潜在的表示不匹配问题。本文提出 4D-VGGT,一个具备divide-and-conquer时空表示的通用基础模型,用于动态场景几何。我们的模型分为三个方面:1)多场景输入。我们设计一种自适应视觉网格,支持任意数量视角和时间步的输入序列。2)多层表示。我们提出一种跨视角全局融合用于空间表示,以及跨时间局部融合用于时间表示。3)多任务预测。我们在时空表示上附加多个任务特定头部,实现对动态场景的综合视觉几何估计。在统一框架下,这些组件增强了模型在动态场景中的特征判别性和应用通用性。此外,我们将多个几何数据集用于训练模型,并在多个动态场景几何基准测试上进行大量实验以验证方法的有效性。
引用
@article{arxiv.2511.18416,
title = {4D-VGGT: A General Foundation Model with SpatioTemporal Awareness for Dynamic Scene Geometry Estimation},
author = {Haonan Wang and Hanyu Zhou and Haoyue Liu and Luxin Yan},
journal= {arXiv preprint arXiv:2511.18416},
year = {2025}
}