中文

异步环境中的反应式强化学习

人工智能 2018-06-29 v1 机器学习

摘要

强化学习(RL)智能体与其异步环境之间的关系常被忽视。常用的智能体与环境交互模型,如马尔可夫决策过程(MDP)或半马尔可夫决策过程(SMDP),未能刻画在异步环境中环境状态可能在智能体执行计算期间发生变化这一事实。在异步环境中,最小化反应时间——即智能体对观察作出反应所需时间——也最小化了环境在观察后状态可能发生变化的时长。在许多环境中,智能体的反应时间通过允许环境转变为不合意终止状态或所择动作不再适用的状态,直接影响任务表现。我们提出一类反应式强化学习算法,通过在观察到新状态信息后立即动作来解决异步环境的这一问题。我们在两个异步机器人任务(紧急停止与碰撞预防)上将反应式 SARSA 学习算法与传统 SARSA 学习算法比较,表明反应式 RL 算法将智能体反应时间减少了约算法学习更新所需的时长。这类新反应式算法可在不改变标准学习保证的前提下,促进更安全控制与更快决策。

关键词

引用

@article{arxiv.1802.06139,
  title  = {Reactive Reinforcement Learning in Asynchronous Environments},
  author = {Jaden B. Travnik and Kory W. Mathewson and Richard S. Sutton and Patrick M. Pilarski},
  journal= {arXiv preprint arXiv:1802.06139},
  year   = {2018}
}

备注

11 pages, 7 figures, currently under journal peer review