中文

针对部分已知动力学的线性可解连续 MDP 的 Actor-Critic 方法

人工智能 2017-06-06 v1

摘要

在许多机器人应用中,系统动力学的某些方面可以被精确建模,而其他方面则难以获取或建模。我们提出了一种用于连续状态和动作空间的新型强化学习 (RL) 方法,该方法在系统部分已知且无主动探索的情况下进行学习。它基于 actor-critic 架构求解线性可解马尔可夫决策过程 (L-MDPs),非常适合连续状态和动作空间。与以往基于模型的 L-MDPs RL 方法和路径积分方法相比,actor-critic 学习不需要未控制动力学模型,且重要的是不需要转移噪声水平;然而,它需要已知该问题的控制动力学。我们在两个合成测试问题以及一个仿真中的真实世界问题上评估了该方法,并使用了真实交通数据。我们的实验表明,学习能力和策略性能均有所提升。

关键词

引用

@article{arxiv.1706.01077,
  title  = {Actor-Critic for Linearly-Solvable Continuous MDP with Partially Known Dynamics},
  author = {Tomoki Nishi and Prashant Doshi and Michael R. James and Danil Prokhorov},
  journal= {arXiv preprint arXiv:1706.01077},
  year   = {2017}
}

备注

10 pages, 7 figures