中文

深度强化学习中的知识引导探索

机器学习 2022-10-31 v1 人工智能

摘要

本文提出一种新方法,用于大幅加速具有状态-动作可容许性(SAP)性质问题的深度强化学习(deep RL)训练。在 SAP 下定义了两类可容许性。第一类是指,在状态 sts_t 中执行动作 ata_t 且智能体到达新状态 st+1s_{t+1} 后,智能体可判定 ata_tsts_t 中是否可容许。第二类是指,即便未在 sts_t 中执行 ata_t,智能体已可判定 ata_tsts_t 中是否可容许。若某动作在任何情况下都无法导向最优解,从而不应被(反复)尝试,则该动作在某一状态中不可容许。我们将提出的 SAP 性质纳入两种最先进的深度 RL 算法,并将动作可容许性知识连同虚拟停止策略一起编码以引导其状态-动作探索。结果表明,基于 SAP 的引导可显著加速 RL 训练。

关键词

引用

@article{arxiv.2210.15670,
  title  = {Knowledge-Guided Exploration in Deep Reinforcement Learning},
  author = {Sahisnu Mazumder and Bing Liu and Shuai Wang and Yingxuan Zhu and Xiaotian Yin and Lifeng Liu and Jian Li},
  journal= {arXiv preprint arXiv:2210.15670},
  year   = {2022}
}

备注

This paper is an extended and revised version of the work: "Action permissibility in deep reinforcement learning and application to autonomous driving", KDD'18 Deep Learning Day (2018)