中文

基于状态抽象的强化学习环境塑造

机器学习 2020-06-24 v1 机器学习

摘要

强化学习(RL)智能体面临的核心挑战之一是在具有稀疏且含噪反馈信号的大状态空间环境中有效学习(近)最优策略。在现实应用中,具备额外领域知识的专家可通过\emph{塑造环境}(即使环境对学习者更友好)来加速学习过程。文献中一种流行的范式是\emph{基于势的奖励塑造},其利用势函数对环境奖励函数增补额外的局部奖励。然而,基于势的奖励塑造在以下情形中适用性有限:(i)状态空间非常大,难以计算合适的势函数;(ii)反馈信号含噪,即便使用塑造后的奖励,智能体仍可能陷入局部最优;(iii)仅改变奖励并不充分,有效的塑造需要改变动力学。我们针对基于势的塑造方法的这些局限,提出了一种新颖的\emph{基于状态抽象的环境塑造}框架。我们的核心思想是将环境含噪信号的大状态空间压缩至抽象空间,并利用该抽象为智能体创建更平滑且更有效的反馈信号。我们研究了基于抽象的环境塑造的理论基础,并表明智能体在塑造环境中学习到的策略在原始环境中保持近最优行为。

关键词

引用

@article{arxiv.2006.13160,
  title  = {Environment Shaping in Reinforcement Learning using State Abstraction},
  author = {Parameswaran Kamalaruban and Rati Devidze and Volkan Cevher and Adish Singla},
  journal= {arXiv preprint arXiv:2006.13160},
  year   = {2020}
}