穿越画作:来自互联网先验的环视世界模型
计算机视觉与模式识别
2026-01-22 v1
摘要
如果视频生成模型不仅能想象一个合理的未来,而且能准确地反映世界因每次行动而发生的正确变化呢?我们通过提出 Egocentric World Model (EgoWM),一种 simple、architecture-agnostic 方法,将任何预训练的视频扩散模型转换为具有动作条件的世界模型,从而实现可控的未来预测。我们并非从头训练,而是复用互联网规模视频模型的丰富世界先验,通过轻量级条件层注入动力学命令。这使模型能够忠实地遵循动作,同时保持真实性和强大的泛化能力。我们的做法天然地跨越了各种 embodiment 和 action space,从 3-DoF 的移动机器人到 25-DoF 的人类机器人,预测以关节角为驱动的环视动力学要困难得多。该模型为导航和操控任务产生连贯的 rollout,仅需 modest fine-tuning。为独立于视觉外观的物理正确性评估,我们引入 Structural Consistency Score (SCS),衡量稳定场景元素是否根据提供的动作进行一致演化。EgoWM 在先前 state-of-the-art navigation world model 基础上将 SCS 提升了最高可达 80 percent,同时实现了最高可达 6 倍的低推理延迟,并对未见环境实现 robust generalization,包括在画作内部进行导航。
引用
@article{arxiv.2601.15284,
title = {Walk through Paintings: Egocentric World Models from Internet Priors},
author = {Anurag Bagchi and Zhipeng Bao and Homanga Bharadhwaj and Yu-Xiong Wang and Pavel Tokmakov and Martial Hebert},
journal= {arXiv preprint arXiv:2601.15284},
year = {2026}
}