中文

探测潜在世界:在潜在表示中涌现的离散符号与物理结构

机器学习 2026-03-24 v1 人工智能 计算机视觉与模式识别

摘要

采用联合嵌入预测架构(JEPA)训练的视频世界模型通过预测潜在空间中的被遮盖区域来获取丰富的时空表征,取代像级重构。这一机制消除了生成模型的视觉验证路径,造成结构可解释性差距:编码器学习到的物理结构难以以可检验形式呈现。现有探测方法要么在连续空间中运行,缺乏结构化中间层;要么附加生成组件,其参数干扰对编码器行为的归因。我们提出 AI Mother Tongue(AIM)框架作为被动量化探测器:一种轻量级、无词汇表的探测器,将 V-JEPA 2 连续潜在向量转换为无任务特定监督或修改编码器的离散符号序列。由于编码器完全冻结,任何符号结构都可归因于 V-JEPA 2 预训练表征——而非探测器。我们通过在 Kinetics-mini 上的类别对比实验,从三个物理维度(抓取角度、物体几何形态和运动时间结构)进行评估。AIM 符号分布在所有三个实验中均显著不同(chi^2 p < 10^{-4};MI 0.036--0.117 比特,NMI 1.2--3.9% 占 3 位最大比特;JSD 最高达 0.342;词表活跃比率 62.5%)。实验表明,V-JEPA 2 潜在空间极度紧凑:不同动作类别共享相同的表征核心,语义差异以分级分布变化而非类别边界编码。这些结果确立了四阶段路线图的第一阶段,表明结构化符号流形是冻结 JEPA 潜在空间的可发现性质。

关键词

引用

@article{arxiv.2603.20327,
  title  = {Probing the Latent World: Emergent Discrete Symbols and Physical Structure in Latent Representations},
  author = {Liu hung ming},
  journal= {arXiv preprint arXiv:2603.20327},
  year   = {2026}
}

备注

35 pages, 6 figures, 3 tables, 26 equations; independent research report; Stage 1 of a four-stage AIM--V-JEPA 2 integration roadmap; code available at https://github.com/cyrilliu1974/JEPA