中文

DinerDash Gym:高维动作空间策略学习的基准

机器学习 2020-07-14 v1 人工智能 机器学习

摘要

由于缺乏公认的基准,在高维动作空间的分层任务领域中评估策略学习算法的进展一直很艰巨。本工作中,我们提出一个名为Diner Dash的轻量级基准任务,用于评估在具高维动作空间的复杂任务中的性能。与仅有扁平目标结构和极少动作的传统Atari游戏不同,所提基准任务具有分层任务结构且动作空间大小为57,因而可促进复杂任务中策略学习的发展。此外,我们引入分解策略图建模(DPGM),一种结合图建模与深度学习的算法,允许显式领域知识嵌入,并相较基线取得显著改进。实验中,我们通过专门设计的模仿算法展示了领域知识注入的有效性以及其他流行算法的结果。

关键词

引用

@article{arxiv.2007.06207,
  title  = {DinerDash Gym: A Benchmark for Policy Learning in High-Dimensional Action Space},
  author = {Siwei Chen and Xiao Ma and David Hsu},
  journal= {arXiv preprint arXiv:2007.06207},
  year   = {2020}
}