中文

从视频基础模型推断动态物理属性

计算机视觉与模式识别 2026-04-14 v2 机器学习

摘要

我们研究从视频中预测动态物理属性的任务。更具体地说,我们考虑需要时间信息才能推断的物理属性:弹跳物体的弹性、流动液体的粘度以及物体在表面上滑动的动态摩擦。为此,我们做出以下贡献:(i)我们为每种物理属性收集了一个新的视频数据集,包含合成训练和测试划分,以及一个用于真实世界评估的真实划分。(ii)我们探索了三种从视频中推断物理属性的方法:(a)一种oracle方法,使用经典计算机视觉技术提供内在地反映该属性的视觉线索;(b)一种简单的读出机制,使用视觉提示和可训练提示向量对预训练视频生成和自监督模型进行交叉注意力;(c)多模态大语言模型(MLLM)的提示策略。(iii)我们表明,在生成方式下训练的视频基础模型(DynamiCrafter)或以自监督方式训练的模型(V-JEPA-2)取得了总体相似但不及oracle的性能,而MLLM目前劣于其他模型,尽管其性能可通过合适的提示策略得到改善。数据集、模型和代码可在 https://www.robots.ox.ac.uk/~vgg/research/idpp/ 获取。

关键词

引用

@article{arxiv.2510.02311,
  title  = {Inferring Dynamic Physical Properties from Video Foundation Models},
  author = {Guanqi Zhan and Xianzheng Ma and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2510.02311},
  year   = {2026}
}