从演示中学习记忆依赖的连续控制
机器学习
2021-02-19 v1 人工智能
摘要
高效探索在强化学习中一直是个长期挑战,尤其在奖励稀疏时。发育系统可通过从演示与自主探索中学习来克服此困难。然而,现有方法不适用于大多数真实世界机器人控制问题,因为它们假设环境遵循马尔可夫决策过程(MDP);因此无法扩展到需历史观测才能决策的部分可观测环境。本文基于为记忆依赖连续控制重放演示的思路,提出一种新算法——带演示与经验重放的循环 actor-critic (READER)。涉及若干记忆关键连续控制任务的实验表明,使用我们方法及数量合理的少量演示样本,可显著减少与环境的交互。该算法在样本效率与学习能力上也优于从演示进行基于记忆控制的基线强化学习算法。
引用
@article{arxiv.2102.09208,
title = {Learning Memory-Dependent Continuous Control from Demonstrations},
author = {Siqing Hou and Dongqi Han and Jun Tani},
journal= {arXiv preprint arXiv:2102.09208},
year = {2021}
}
备注
10 pages, 6 figures