中文

基于变分状态表格化的高效模型深度强化学习

机器学习 2018-06-12 v2 人工智能 机器学习

摘要

现代强化学习算法在许多棋盘和视频游戏中达到超人类表现,但它们样本效率低,即通常比人类需要显著更多的游戏经验才能达到同等表现水平。为提高样本效率,智能体可建立环境模型并使用规划方法更新其策略。在本文中,我们引入变分状态表格化(VaST),它将具有高维状态空间(例如视觉输入空间)的环境映射到一个抽象表格模型。然后可使用具有小回溯的优先扫描(一种高效的规划方法)来更新状态-动作值。我们展示了VaST如何快速学习在3D导航等任务中最大化奖励,并有效适应奖励或转移概率的突变。

关键词

引用

@article{arxiv.1802.04325,
  title  = {Efficient Model-Based Deep Reinforcement Learning with Variational State Tabulation},
  author = {Dane Corneil and Wulfram Gerstner and Johanni Brea},
  journal= {arXiv preprint arXiv:1802.04325},
  year   = {2018}
}

备注

Accepted at ICML 2018; camera-ready version