中文

在深度强化学习经验回放中混合人类示范与自主探索

人工智能 2021-07-15 v1

摘要

我们研究了在深度强化学习的回放缓冲中使用人类示范数据的效果。我们采用一种带修正经验回放缓冲的策略梯度方法,其中以给定概率采样一条人类示范经验。我们分析了在智能体试图到达目标并避开障碍物的任务中,使用不同比例的示范数据的情况。我们的结果表明,虽然纯自主探索和纯示范训练的智能体成功率相近,但纯示范模型以更少的步数更快收敛到解。

关键词

引用

@article{arxiv.2107.06840,
  title  = {Mixing Human Demonstrations with Self-Exploration in Experience Replay for Deep Reinforcement Learning},
  author = {Dylan Klein and Akansel Cosgun},
  journal= {arXiv preprint arXiv:2107.06840},
  year   = {2021}
}

备注

2 pages. Submitted to ICDL 2021 Workshop on Human aligned Reinforcement Learning for Autonomous Agents and Robots