中文

物理启发的半马尔可夫环境中的强化学习

机器学习 2020-04-17 v1 人工智能

摘要

强化学习(RL)已被证明在许多科学发现与设计的应用中具有巨大潜力。近期工作包括例如用于治疗药物的新分子结构与组分设计。然而,现有将 RL 应用于科学领域的工作大多假设可用的状态表示满足马尔可夫性质。由于时间、成本、传感器精度和科学知识缺口等原因,许多科学设计与发现问题并不满足马尔可夫性质。因此,应使用马尔可夫决策过程(MDP)以外的东西来规划/寻找最优策略。本文中,我们提出一个物理启发的半马尔可夫 RL 环境,即相变环境。此外,我们在所提环境中评估了基于值的 RL 算法在 MDP 与部分可观测 MDP(POMDP)上的性能。我们的结果表明深度循环 Q 网络(DRQN)显著优于深度 Q 网络(DQN),且 DRQN 受益于用后见之明经验回放(hindsight experience replay)进行训练。本文也讨论了半马尔可夫 RL 与 POMDP 在科学实验室中的应用意义。

关键词

引用

@article{arxiv.2004.07333,
  title  = {Reinforcement Learning in a Physics-Inspired Semi-Markov Environment},
  author = {Colin Bellinger and Rory Coles and Mark Crowley and Isaac Tamblyn},
  journal= {arXiv preprint arXiv:2004.07333},
  year   = {2020}
}

备注

To appear in the Canadian Conference on Artificial Intelligence, 2020