中文

WHALE:迈向用于具身决策的可泛化与可扩展世界模型

机器学习 2024-11-11 v1

摘要

世界模型在具身环境中的决策中发挥关键作用,使原本在现实世界中代价高昂的无成本探索成为可能。为了促进有效决策,世界模型必须具备强大的泛化能力,以支持在分布外(OOD)区域中的忠实想象,并提供可靠的 uncertainty 估计来评估模拟经验的可信度,这两者对先前的可扩展方法都构成了重大挑战。本文介绍了WHALE,一个用于学习可泛化世界模型的框架,由两种关键技术组成:行为条件化和回溯展开。行为条件化解决了世界模型泛化误差的主要来源之一——策略分布偏移,而回溯展开实现了高效的 uncertainty 估计,无需模型集成。这些技术是通用的,可以与任何用于世界模型学习的神经网络架构结合。通过整合这两种技术,我们提出了Whale-ST,一个具有增强泛化能力的可扩展时空Transformer世界模型。我们通过在模拟任务中评估价值估计精度和视频生成保真度来展示Whale-ST的优越性。此外,我们检验了我们的 uncertainty 估计技术的有效性,该技术增强了全离线场景中的基于模型的策略优化。此外,我们提出了Whale-X,一个在Open X-Embodiment数据集上使用970K条轨迹训练的414M参数世界模型。我们表明Whale-X在真实世界操作场景中展现出有前景的可扩展性和强大的泛化能力,仅需最少的演示。

关键词

引用

@article{arxiv.2411.05619,
  title  = {WHALE: Towards Generalizable and Scalable World Models for Embodied Decision-making},
  author = {Zhilong Zhang and Ruifeng Chen and Junyin Ye and Yihao Sun and Pengyuan Wang and Jingcheng Pang and Kaiyuan Li and Tianshuo Liu and Haoxin Lin and Yang Yu and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2411.05619},
  year   = {2024}
}