VGGT-World:将VGGT转化为自回归几何世界模型
动力系统
2026-03-17 v2
摘要
预测通过生成未来视频帧来 forecast 场景演变的世界模型将其容量用于光度细节,但所得预测常保持几何不一致。我们提出了VGGT-World,一种几何世界模型,完全规避视频生成,而是预测冻结几何基础模型(GFM)特征的时间演化。具体而言,我们将冻结的VGGT的隐式 token 作为世界状态,并训练一个轻量级时序 flow transformer 自回归地预测它们的未来轨迹。在这个高维(d=1024)特征空间中,出现两个技术挑战:(i)标准的速度-预测 flow matching 崩溃,以及(ii)自回归 rollout 受累积暴露偏差影响。我们通过干净目标(z-预测)参数化来解决第一个问题,这导致信噪比显著提高;通过两种阶段的隐式 flow-强制 curriculum 来解决第二个问题,这逐步使模型在其自身的部分去噪 rollout 上进行条件。在KITTI、Cityscapes和TartanAir上的实验表明,VGGT-World 在深度预测方面显著优于最强的基线,同时以3.6-5倍的速度运行,仅使用0.43B可训练参数,确立了冻结GFM特征作为3D世界建模有效且高效的预测状态。
引用
@article{arxiv.2603.12656,
title = {Three elliptic closed characteristics on the non-degenerate compact convex hypersurfaces in R^6},
author = {Lu Liu and Yuwei Ou},
journal= {arXiv preprint arXiv:2603.12656},
year = {2026}
}