在深度强化学习经验回放中混合人类示范与自主探索
人工智能
2021-07-15 v1
摘要
我们研究了在深度强化学习的回放缓冲中使用人类示范数据的效果。我们采用一种带修正经验回放缓冲的策略梯度方法,其中以给定概率采样一条人类示范经验。我们分析了在智能体试图到达目标并避开障碍物的任务中,使用不同比例的示范数据的情况。我们的结果表明,虽然纯自主探索和纯示范训练的智能体成功率相近,但纯示范模型以更少的步数更快收敛到解。
引用
@article{arxiv.2107.06840,
title = {Mixing Human Demonstrations with Self-Exploration in Experience Replay for Deep Reinforcement Learning},
author = {Dylan Klein and Akansel Cosgun},
journal= {arXiv preprint arXiv:2107.06840},
year = {2021}
}
备注
2 pages. Submitted to ICDL 2021 Workshop on Human aligned Reinforcement Learning for Autonomous Agents and Robots