潜在视频预测学习更优的世界模型
计算机视觉与模式识别
2026-05-18 v1 人工智能
摘要
自监督视频模型越来越多地被构建为世界模型,然而其评估在很大程度上仍局限于在干净基准上单一的 top-1 准确率分数。这导致在理解它们作为世界模型的潜力方面存在重大空白。我们首次针对这一空白进行了系统性研究,分析了四个容量匹配的前沿视频基础模型 V-JEPA 2.1、V-JEPA 2、VideoPrism 和 VideoMAEv2,在与其作为视频世界模型部署相关的五个鲁棒性轴上进行了评估:特征可辨别性、损坏鲁棒性、细粒度判别、遮挡鲁棒性以及对时间方向的敏感性。我们的评估表明,在所有五个轴上,潜在预测模型形成了一致且独特的特征。它们在像素损坏下性能下降更平缓,在遮挡下保留可用的类别结构而非仅仅是几何稳定性,在不重建像素的情况下捕获细粒度的物理接触线索,并独特地编码了时间之箭。这些优势甚至可以经受任务适应的考验:在损坏和遮挡鲁棒性上,带有轻量级注意力探头的冻结 V-JEPA 2 骨干网络优于完全微调的 VideoMAE 和监督式 TimeSformer。我们广泛的结果为支持潜在预测用于鲁棒世界建模提供了具体的新证据。
引用
@article{arxiv.2605.15618,
title = {Latent Video Prediction Learns Better World Models},
author = {Ali J Alrasheed and Aryan Yazdan Parast and Basim Azam and James Bailey and Naveed Akhtar},
journal= {arXiv preprint arXiv:2605.15618},
year = {2026}
}