中文

基于潜在动作的自我提升世界建模

机器学习 2026-02-17 v2 人工智能 计算与语言

摘要

内部世界建模——预测在动作 ZZ 作用下,状态 XX 与后继状态 YY 之间的转换——是 LLM 和 VLM 进行推理和规划的关键。通常需要高昂的带动作标签的轨迹数据来实现此类建模。我们提出 SWIRL,一款自我提升框架,通过将动作视为潜在变量的方式,从仅包含状态的序列中进行学习,交替进行正向世界建模 (FWM) Pθ(YX,Z)P_\theta(Y|X,Z) 与逆向动力学建模 (IDM) Qϕ(ZX,Y)Q_\phi(Z|X,Y)。SWIRL 迭代两个阶段:(1) 变分信息最大化,更新 FWM 以生成与潜在动作在给定先验状态下的条件互信息最大的后继状态,从而鼓励可辨识的一致性;(2) ELBO 最大化,更新 IDM 以解释观察到的转换,实际上执行坐标上升。两种模型均使用强化学习 (具体为 GRPO) 进行训练,利用相互冻结模型的对数概率作为奖励信号。我们提供了两种更新的理论可学习性保证,并在多个环境中评估了 SWIRL:包括单轮和多轮开放世界视觉动力学、以及用于物理、网页和工具调用的合成文本环境。SWIRL 在 AURORABench 上实现 16% 的提升,在 ByteMorph 上实现 28% 的提升,在 WorldPredictionBench 上实现 16% 的提升,在 StableToolBench 上实现 14% 的提升。

关键词

引用

@article{arxiv.2602.06130,
  title  = {Self-Improving World Modelling with Latent Actions},
  author = {Yifu Qiu and Zheng Zhao and Waylon Li and Yftah Ziser and Anna Korhonen and Shay B. Cohen and Edoardo M. Ponti},
  journal= {arXiv preprint arXiv:2602.06130},
  year   = {2026}
}