中文

DreamingV2:无需重建的离散世界模型强化学习

机器学习 2022-03-02 v1 人工智能 系统与控制 系统与控制

摘要

本文提出了一种新颖的基于世界模型的强化学习方法 DreamingV2,它是 DreamerV2 和 Dreaming 的协同扩展。DreamerV2 是一种前沿的基于模型的像素级强化学习方法,它使用离散世界模型以类别变量表示潜在状态。Dreaming 也是一种像素级强化学习形式,它试图通过引入无需重建的对比学习目标来避免通用世界模型训练中的自编码过程。所提出的 DreamingV2 是一种同时采用 DreamingV2 的离散表示和 Dreaming 的无需重建目标的新方法。与 DreamerV2 及其他近期无需重建的基于模型的方法相比,DreamingV2 在五个模拟的具有挑战性的 3D 机器人手臂任务中取得了最佳分数。我们相信 DreamingV2 将成为机器人学习的可靠解决方案,因为其离散表示适合描述不连续环境,而无需重建的方式能很好地处理复杂的视觉观测。

关键词

引用

@article{arxiv.2203.00494,
  title  = {DreamingV2: Reinforcement Learning with Discrete World Models without Reconstruction},
  author = {Masashi Okada and Tadahiro Taniguchi},
  journal= {arXiv preprint arXiv:2203.00494},
  year   = {2022}
}

备注

The code will be available soon