中文

解读视频世界模型中的物理

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

物理推理中的一个长期问题是,视频基于模型是否需要依赖物理变量的因子化表示以做出准确预测,或是否可以以任务特定的分布式方式隐式表示此类变量。虽然现代视频世界模型在直觉物理基准测试中取得强劲性能,但仍不清楚这些表示性方案在内部实现哪种形式。本文首次提出了直接检验大规模视频编码器内部物理表示的可解释性研究。通过图层级探测、子空间几何、patch 级解码和针对性注意力消除,我们描述了物理信息何时变得可访问以及其在编码器基于视频的变换器中的组织方式。在各种架构中,我们识别出一个明显的中间深度转变——我们称之为物理涌现区(Physics Emergence Zone),在此物理变量变得可访问。物理相关表示在此转变后不久达到峰值,然后向输出层方向退化。将运动分解为显式变量后,我们发现诸如速度和加速度等标量量从早期图层即可获取,而运动方向仅在物理涌现区才可访问。值得注意的是,我们发现方向通过具有圆形几何的高维群体结构进行编码,这需要协调的多特征干预才能控制。这些发现表明,现代视频模型并不像古典物理引擎那样使用物理变量的因子化表示。相反,它们使用分布式表示,尽管足以进行物理预测。

关键词

引用

@article{arxiv.2602.07050,
  title  = {Interpreting Physics in Video World Models},
  author = {Sonia Joseph and Quentin Garrido and Randall Balestriero and Matthew Kowal and Thomas Fel and Shahab Bakhtiari and Blake Richards and Mike Rabbat},
  journal= {arXiv preprint arXiv:2602.07050},
  year   = {2026}
}