好奇心驱动的多准则后见经验回放
机器学习
2019-06-11 v1 人工智能
机器人学
机器学习
摘要
处理稀疏奖励是强化学习中一个长期存在的挑战。近期后见方法的使用已在多种稀疏奖励任务上取得成功,但其在如仿真中用机械臂堆叠多个方块等复杂任务上失效。使用所学动力学模型的预测误差作为内在奖励的好奇心驱动探索,已被证明对探索若干稀疏奖励环境有效。我们提出一种将后见与好奇心驱动探索及课程学习相结合的方法,以解决具挑战性的稀疏奖励方块堆叠任务。我们首次仅使用稀疏奖励且无人类示范地堆叠超过两个方块。
引用
@article{arxiv.1906.03710,
title = {Curiosity-Driven Multi-Criteria Hindsight Experience Replay},
author = {John B. Lanier and Stephen McAleer and Pierre Baldi},
journal= {arXiv preprint arXiv:1906.03710},
year = {2019}
}
备注
14 pages