中文

HCLSM:基于层次因果潜在状态机的面向对象中心的世界建模

机器学习 2026-04-01 v1 计算机视觉与模式识别 机器人学

摘要

预测视频未来状态的世界模型仍受限于平坦潜在表征,这些表征会混合对象、忽略因果结构并将时序动力学压缩到单个尺度。我们提出 HCLSM,一种在三个相互关联原则下运作的世界模型架构:通过插槽注意力实现对象中心分解并采用空间广播解码、通过三级引擎实现层次时序动力学——该引擎组合连续物理的选择性状态空间模型、离散事件的稀疏变压器以及抽象目标的压缩变压器、通过图神经网络交互模式实现因果结构学习。HCLSM 引入两个阶段的训练协议:空间重构驱动插槽专职化,随后开始动态预测。我们在 Open X-Embodiment 数据集上的 PushT 机器人操控基准上训练了一个 6800 万参数模型,实现 0.008 的 MSE 下一状态预测损失,观察到显现的空间分解(SBD 损失:0.0075)以及学习到的事件边界。自定义 Triton 核对 SSM scan 性能提升了 38 倍。整个系统跨 51 个模块、8478 行 Python 代码,包含 171 个单元测试。代码:https://github.com/rightnow-ai/hclsm

关键词

引用

@article{arxiv.2603.29090,
  title  = {HCLSM: Hierarchical Causal Latent State Machines for Object-Centric World Modeling},
  author = {Jaber Jaber and Osama Jaber},
  journal= {arXiv preprint arXiv:2603.29090},
  year   = {2026}
}

备注

10 pages, 3 tables, 4 figures, 1 algorithm. Code: https://github.com/rightnow-ai/hclsm