基于模型的强化学习中利用简化模型与近似乐观规划实现快速探索
人工智能
2018-11-27 v2
摘要
人类学习玩视频游戏的速度显著快于最先进的强化学习(RL)算法。人们似乎构建了易于学习的简单模型来支持规划和策略性探索。受此启发,我们研究了在利用基于模型的RL提升样本效率时的两个问题。首先,我们研究在精确规划不可行时如何进行策略性探索,并通过实验表明乐观蒙特卡洛树搜索优于后验采样方法。其次,我们展示了如何学习简单的确定性模型,以利用对象表示支持快速学习。我们通过引入一种新算法——策略对象导向强化学习(SOORL)来说明这些想法的益处,该算法在Pitfall!游戏中以少于50回合的表现优于最先进算法。
引用
@article{arxiv.1806.00175,
title = {Fast Exploration with Simplified Models and Approximately Optimistic Planning in Model Based Reinforcement Learning},
author = {Ramtin Keramati and Jay Whang and Patrick Cho and Emma Brunskill},
journal= {arXiv preprint arXiv:1806.00175},
year = {2018}
}