深度强化学习中的知识引导探索
机器学习
2022-10-31 v1 人工智能
摘要
本文提出一种新方法,用于大幅加速具有状态-动作可容许性(SAP)性质问题的深度强化学习(deep RL)训练。在 SAP 下定义了两类可容许性。第一类是指,在状态 中执行动作 且智能体到达新状态 后,智能体可判定 在 中是否可容许。第二类是指,即便未在 中执行 ,智能体已可判定 在 中是否可容许。若某动作在任何情况下都无法导向最优解,从而不应被(反复)尝试,则该动作在某一状态中不可容许。我们将提出的 SAP 性质纳入两种最先进的深度 RL 算法,并将动作可容许性知识连同虚拟停止策略一起编码以引导其状态-动作探索。结果表明,基于 SAP 的引导可显著加速 RL 训练。
引用
@article{arxiv.2210.15670,
title = {Knowledge-Guided Exploration in Deep Reinforcement Learning},
author = {Sahisnu Mazumder and Bing Liu and Shuai Wang and Yingxuan Zhu and Xiaotian Yin and Lifeng Liu and Jian Li},
journal= {arXiv preprint arXiv:2210.15670},
year = {2022}
}
备注
This paper is an extended and revised version of the work: "Action permissibility in deep reinforcement learning and application to autonomous driving", KDD'18 Deep Learning Day (2018)