面向因果视频预测的实体中心世界模型:交互感知式掩码
计算机视觉与模式识别
2026-05-18 v1
摘要
从无标签视频中学习预测世界模型是人工智能中的一项基础性挑战。虽然联合嵌入预测架构(JEPA)在语义分类方面取得了新纪录,但它们往往缺乏对物理因果动态的捕捉,难以满足下游推理需求。我们假设,这源于标准基于块的掩码策略——其优先考虑视觉纹理而非少数且信息丰富的运动事件。我们提出交互感知式JEPA(IA-JEPA),采用自监督运动中心掩码策略以优先处理物理相互作用。通过特别定位发生碰撞或动量传递的实体,我们迫使架构重建潜在轨迹,而非静态背景特征。在CLEVRER基准测试上,IA-JEPA在因果推理任务上实现了14.26%的准确率,而标准块掩码基线仅达3.22%。关键在于,我们展示了IA-JEPA突破了标准自监督的“静态偏见”,通过诱导更高熵、更具辨识度的潜在空间(熵提升10%),实现对物理能量的线性化()。我们表明这种交互偏差可推广至真实世界的人类动作(Something-Something V2)以及零样本物理拼图(PHYRE-Lite)。我们的结果为构建从自监督方式开始即可内化物理世界因果结构的基础世界模型提供了可扩展的路径。
引用
@article{arxiv.2605.15466,
title = {Entity-Centric World Models: Interaction-Aware Masking for Causal Video Prediction},
author = {Santosh Kumar Paidi},
journal= {arXiv preprint arXiv:2605.15466},
year = {2026}
}
备注
12 pages, 4 figures