Frozen Forecasting:一项统一评估
计算机视觉与模式识别
2026-04-16 v2 人工智能
机器学习
摘要
预测未来事件是在不同抽象层级上进行规划或行动的通用系统的基本能力。然而,由于未来的固有不确定性,评估预测是否“正确”仍然具有挑战性。我们提出了一个统一的评估框架,用于评估冻结的视觉主干网络在不同任务和抽象层级上的预测能力。我们的框架不关注单一时间步,而是评估整个轨迹,并引入了能更好地捕捉未来结果多模态性质的分布度量指标。给定一个冻结的视觉模型,我们训练潜在扩散模型直接在其表征空间中预测未来特征,然后通过轻量级的、特定任务的读出进行解码。这使得我们能够在一系列多样化的任务中进行一致的评估,同时隔离主干网络本身的预测能力。我们将该框架应用于九个不同的视觉模型,涵盖图像和视频预训练、对比和生成目标,以及有无语言监督的情况,并在四个预测任务上对它们进行评估,从低层像素预测到高层对象运动。我们发现预测性能与感知质量高度相关,并且在所有抽象层级上,视频合成模型的预测能力与在掩蔽机制下预训练的模型相当或更优。然而,语言监督并未持续改善预测性能。值得注意的是,视频预训练模型始终优于基于图像的模型。
引用
@article{arxiv.2507.13942,
title = {Frozen Forecasting: A Unified Evaluation},
author = {Jacob C Walker and Pedro Vélez and Luisa Polania Cabrera and Guangyao Zhou and Sayna Ebrahimi and Rishabh Kabra and Carl Doersch and Maks Ovsjanikov and João Carreira and Shiry Ginosar},
journal= {arXiv preprint arXiv:2507.13942},
year = {2026}
}
备注
New Title, Additional Author