用于规划的向量量化模型
机器学习
2021-06-11 v2 人工智能
机器学习
摘要
基于模型的强化学习(RL)领域的近期进展已在一系列环境中证明成功,尤其是那些规划至关重要的环境。然而,此类成功仅限于确定性的完全可观测环境。我们提出一种处理随机且部分可观测环境的新方法。我们的核心见解是使用离散自编码器来捕捉随机环境中一个动作可能产生的多种效果。我们使用蒙特卡洛树搜索的随机变体,对智能体的动作以及代表环境响应的离散潜变量进行规划。我们的方法在将对手视为环境一部分的随机化国际象棋解释上,显著优于 MuZero 的离线版本。我们还展示了我们的方法可扩展至 DeepMind Lab——一个具有大型视觉观测与部分可观测性的第一人称 3D 环境。
引用
@article{arxiv.2106.04615,
title = {Vector Quantized Models for Planning},
author = {Sherjil Ozair and Yazhe Li and Ali Razavi and Ioannis Antonoglou and Aäron van den Oord and Oriol Vinyals},
journal= {arXiv preprint arXiv:2106.04615},
year = {2021}
}
备注
ICML 2021