中文

通过物理交互无语言监督的世界模型中涌现的语义表征

机器学习 2026-05-29 v1 人工智能

摘要

在没有语言监督的情况下,世界模型从物理探索中学习什么?我们认为答案由单个原则组织:物理世界的几何结构。在对随机具身探索训练基于变分自编码器的世界模型时,我们发现其隐空间发展出与物理几何相吻合的空间语义结构——方向准确率为 0.677±0.029,远高于随机初始化编码器的 0.547;位置 RSA 为 0.192±0.047,远高于随机编码器的 0.029(提升了 6.6 倍),表明训练诱导了超出 CNN 归纳偏置的真实结构组织。在 20 个时间检查点上,预测性能和语义对齐性同步提升(Spearman r=-0.61, p=0.004),与共享驱动账户相一致。我们通过双敲除法确认:标准 KL 正则化(beta=0.1)迫使编码器偏离几何结构,预测性能和语义对齐性在第 50,000 步时几乎全部崩溃至接近随机,正如共享驱动账户所预测;将 beta 降低到 0.001可恢复几何访问并同时恢复两项能力。这些发现确立了物理世界几何作为世界模型表征的组织原则,为设计具语义 grounding 的具身智能体提供了直接含义。

关键词

引用

@article{arxiv.2605.28865,
  title  = {Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision},
  author = {Jiayi Fang},
  journal= {arXiv preprint arXiv:2605.28865},
  year   = {2026}
}

备注

10 pages, 3 figures