中文

用于 MDP 规划的深度反应式策略迁移

人工智能 2018-10-30 v1

摘要

领域无关概率规划器以 PPDDL 或 RDDL 等因子化表示语言输入 MDP 描述,并利用该表示的具体特性实现更快规划。传统算法独立处理每个问题实例,且不存在将领域其他实例的策略经验迁移到新实例的良好方法。近来,研究者开始探索使用通过深度强化学习(RL)训练的深度反应式策略用于 MDP 规划领域。深度反应式策略的一个优势是更易于进行迁移学习。本文中,我们提出首个用于以 RDDL 表示的 MDP 规划领域的领域无关迁移算法。我们的架构利用该领域的符号状态配置与转移函数(可通过 RDDL 获得)来学习一个领域所有问题实例的状态与状态-动作对的共享嵌入空间。随后我们在该嵌入空间中学习一个 RL 智能体,使得近乎零样本迁移成为可能,即无需在新实例上进行大量训练,且完全不使用领域模拟器。在三个不同基准领域上的实验凸显了我们迁移算法的价值。与从头规划以及最先进的 RL 迁移算法相比,我们的迁移方案具有显著更优的学习曲线。

关键词

引用

@article{arxiv.1810.11488,
  title  = {Transfer of Deep Reactive Policies for MDP Planning},
  author = {Aniket Bajpai and Sankalp Garg and Mausam},
  journal= {arXiv preprint arXiv:1810.11488},
  year   = {2018}
}

备注

To appear at NIPS 2018