中文

LaWM:面向视觉观测长程物理一致性的最小作用量世界模型

机器学习 2026-05-12 v1 人工智能

摘要

从视觉观测中学习预测性世界模型是具身人工智能的核心问题,可应用于基于模型的强化学习和机器人规划。现有的潜在世界模型通常使用无约束的神经转移函数生成未来状态,而现代视频生成系统通常优先考虑感知合理性,或通过辅助损失、外部引导或单独的动力学模块引入物理结构。因此,长程展开可能仍然与支配真实动力学的物理原理关联薄弱,导致累积误差、能量漂移和物理不一致的未来。我们提出了最小作用量世界模型(LaWM),这是一个在学习的视觉潜在空间中运作最小作用量原理的潜在世界建模框架:未来展开由学习的拉格朗日作用量泛函控制,而不仅仅由无约束的转移预测器产生。我们的主要技术实现是潜在变分积分器:LaWM将观测编码为学习的广义坐标,学习连续潜在状态上的潜在离散拉格朗日量,构建离散作用量泛函,并通过求解相应的离散积分条件来推进预测。因此,物理结构不仅用于评分、正则化或约束已完成的轨迹;它定义了潜在转移规则本身。由于转移是由离散变分原理诱导的,LaWM为长程视觉预测提供了结构保持的偏置。在物理清晰的合成动力学和具身机器人交互基准测试中,与视频生成和世界模型基线相比,LaWM在物理不变性、背景一致性、运动平滑性以及外观和几何预测指标方面均有改进。

关键词

引用

@article{arxiv.2605.08279,
  title  = {LaWM: Least Action World Models for Long-Horizon Physical Consistency from Visual Observations},
  author = {Qixin Xiao and Maani Ghaffari},
  journal= {arXiv preprint arXiv:2605.08279},
  year   = {2026}
}