中文

为规划与控制提升具象世界模型

计算机视觉与模式识别 2026-04-30 v1 人工智能 机器学习

摘要

具象智能体的世界模型会根据智能体执行的动作来预测未来观测。对于复杂的具象体,动作空间是高维且难以指定的:例如,精确控制人类智能体需要指定每个关节的运动。这使得世界模型难以控制,且在计划时成本高昂,因为类似 CEM 的基于搜索的方法会随动作维度而性能恶化。为此,我们训练一个轻量级策略,将高级动作映射到低级关节动作序列。将该策略与冻结的世界模型组合,可产生预测从单个高级动作到多个未来观测序列的提升后世界模型。我们针对人类化具象体实现了此框架,将高级动作空间定义为一小组标注在当前观测帧上的 2D waypoints,每一点指定叶子关节(髋部、头部、手部)的近期目标位置。Waypoints 维度低、在视觉上可解释,且可手动指定或搜索。我们表明,提升后的世界模型在低级关节空间中直接搜索时性能显著优于 3.8×3.8\times 的平均关节误差(到达目标姿态),同时仍具计算效率优势,并能推广到政策未见过的环境。

关键词

引用

@article{arxiv.2604.26182,
  title  = {Lifting Embodied World Models for Planning and Control},
  author = {Alex N. Wang and Trevor Darrell and Pavel Izmailov and Yutong Bai and Amir Bar},
  journal= {arXiv preprint arXiv:2604.26182},
  year   = {2026}
}