通过物理交互无语言监督的世界模型中涌现的语义表征
机器学习
2026-05-29 v1 人工智能
摘要
在没有语言监督的情况下,世界模型从物理探索中学习什么?我们认为答案由单个原则组织:物理世界的几何结构。在对随机具身探索训练基于变分自编码器的世界模型时,我们发现其隐空间发展出与物理几何相吻合的空间语义结构——方向准确率为 0.677±0.029,远高于随机初始化编码器的 0.547;位置 RSA 为 0.192±0.047,远高于随机编码器的 0.029(提升了 6.6 倍),表明训练诱导了超出 CNN 归纳偏置的真实结构组织。在 20 个时间检查点上,预测性能和语义对齐性同步提升(Spearman r=-0.61, p=0.004),与共享驱动账户相一致。我们通过双敲除法确认:标准 KL 正则化(beta=0.1)迫使编码器偏离几何结构,预测性能和语义对齐性在第 50,000 步时几乎全部崩溃至接近随机,正如共享驱动账户所预测;将 beta 降低到 0.001可恢复几何访问并同时恢复两项能力。这些发现确立了物理世界几何作为世界模型表征的组织原则,为设计具语义 grounding 的具身智能体提供了直接含义。
引用
@article{arxiv.2605.28865,
title = {Emergent Semantic Representations in World Models through Physical Interaction without Linguistic Supervision},
author = {Jiayi Fang},
journal= {arXiv preprint arXiv:2605.28865},
year = {2026}
}
备注
10 pages, 3 figures