中文

强化学习中的临界性概念

机器学习 2018-10-18 v1 人工智能 多智能体系统 机器学习

摘要

强化学习方法在用于最优控制的n步算法中带有众所周知的偏差-方差权衡。遗憾的是,当前研究很少涉及这一点。该权衡原理独立于算法的选择,如n步SARSA、n步Expected SARSA或n步Tree backup。小的n导致大偏差,而大的n导致大方差。文献未给出该值最佳选择的直截了当的方案。虽然目前所有n步算法在状态空间上使用固定的n,我们通过允许每个状态拥有其特定的n来扩展n步更新框架。我们在人类辅助强化学习的背景下提出该问题的解决方案。我们的方法基于如下观察:如果人类接收到关于给定状态临界性以及因此需要在该状态投入多少注意力的输入,她可以学习得更高效。这一观察与如下思想相关:MDP的每个状态都有某种临界性度量,指示该状态中动作的选择如何影响回报。在我们的算法中,RL智能体利用由人类训练者提供的临界性度量函数,以局部地选择用于Q函数更新的最佳步数n。

关键词

引用

@article{arxiv.1810.07254,
  title  = {The Concept of Criticality in Reinforcement Learning},
  author = {Yitzhak Spielberg and Amos Azaria},
  journal= {arXiv preprint arXiv:1810.07254},
  year   = {2018}
}