VFMF:通过预测视觉基础模型特征进行世界建模
计算机视觉与模式识别
2025-12-15 v1 人工智能
机器学习
摘要
从部分观测中进行预测是世界建模的核心。许多近期方法通过图像表示世界,并将预测简化为随机视频生成。尽管此类方法在真实感和视觉保真度方面表现出色,但预测像素计算密集,且在许多应用中并不直接有用,因为它需要将RGB转换为对决策有用的信号。另一种方法使用视觉基础模型(VFM)的特征作为世界表示,通过确定性回归来预测未来世界状态。这些特征可以直接转换为可操作的信号,如语义分割和深度,同时保持计算效率。然而,确定性回归对多个可能的未来进行平均,通过未能捕捉不确定性而削弱预测准确性。为解决这一关键限制,我们引入了一个在VFM特征空间中进行自回归流匹配的生成预测器。我们的关键洞察是,该空间中的生成建模需要将VFM特征编码到适合扩散的紧凑潜在空间中。我们证明,与之前使用的基于PCA的替代方案相比,该潜在空间在预测和其他应用(如图像生成)中都能更有效地保留信息。我们的潜在预测可以轻松解码为多种有用且可解释的输出模态:语义分割、深度、法线方向,甚至RGB。在架构和计算匹配的情况下,我们的方法在所有模态上产生了比回归更锐利、更准确的预测。我们的结果表明,VFM特征的随机条件生成为未来世界模型提供了一个有前景且可扩展的基础。
引用
@article{arxiv.2512.11225,
title = {VFMF: World Modeling by Forecasting Vision Foundation Model Features},
author = {Gabrijel Boduljak and Yushi Lan and Christian Rupprecht and Andrea Vedaldi},
journal= {arXiv preprint arXiv:2512.11225},
year = {2025}
}