KoGuN:通过融合人类次优知识加速深度强化学习
人工智能
2020-05-22 v2
摘要
强化学习智能体通常从零开始学习,这需要与环境进行大量交互。这与人类的学习过程大不相同。当面对新任务时,人类自然具备常识并利用先验知识推导初始策略并指导后续学习过程。尽管先验知识可能并不完全适用于新任务,但由于初始策略确保了学习的快速启动,且中间指导可避免不必要的探索,学习过程得以显著加速。受此启发,我们提出知识引导策略网络(KoGuN),一种将人类先验次优知识与强化学习相结合的新型框架。我们的框架由一个表示人类知识的模糊规则控制器和一个用于微调次优先验知识的精炼模块组成。所提框架是端到端的,并且可与现有的基于策略的强化学习算法结合。我们在离散与连续控制任务上进行了实验。实证结果表明,我们的方法将人类次优知识与 RL 相结合,即使在人类先验知识性能很低的情况下,也能在扁平 RL 算法的学习效率上取得显著提升。
引用
@article{arxiv.2002.07418,
title = {KoGuN: Accelerating Deep Reinforcement Learning via Integrating Human Suboptimal Knowledge},
author = {Peng Zhang and Jianye Hao and Weixun Wang and Hongyao Tang and Yi Ma and Yihai Duan and Yan Zheng},
journal= {arXiv preprint arXiv:2002.07418},
year = {2020}
}