中文

为世界模型学习潜在动态鲁棒表征

机器学习 2024-05-31 v2 人工智能

摘要

基于视觉的模型强化学习(MBRL)有望封装智能体关于环境底层动态的知识,从而学习一个世界模型作为有用的规划器。然而,由于未能捕获任务特定特征同时滤除无关的时空细节,像Dreamer这样的顶级MBRL智能体在观测空间存在外生或无关噪声的情况下,常常难以处理基于视觉像素的输入。为解决此问题,我们应用时空掩码策略、互模拟原理,并结合潜在重建,来捕获环境的内生任务特定方面以构建世界模型,从而有效消除非必要信息。表征、动态和策略的联合训练常导致不稳定性。为进一步解决此问题,我们开发了一种混合循环状态空间模型(HRSSM)结构,增强状态表征的鲁棒性以实现有效的策略学习。我们的实证评估表明,在一系列视觉复杂的控制任务中,例如带有来自Matterport环境的外生干扰物的Maniskill任务,性能相比现有方法有显著提升。我们的代码可在 https://github.com/bit1029public/HRSSM 获取。

关键词

引用

@article{arxiv.2405.06263,
  title  = {Learning Latent Dynamic Robust Representations for World Models},
  author = {Ruixiang Sun and Hongyu Zang and Xin Li and Riashat Islam},
  journal= {arXiv preprint arXiv:2405.06263},
  year   = {2024}
}