中文

基于宽度的前瞻结合习得基策略与启发式方法在Atari-2600基准上的表现

人工智能 2021-10-29 v2

摘要

我们提出了新的基于宽度的规划与学习算法,其灵感来源于对先前基于宽度的规划器所做设计决策的细致分析。这些算法应用于Atari-2600游戏,而我们性能最佳的算法——新颖性引导的关键路径学习(N-CPL),优于先前引入的基于宽度的规划与学习算法π\pi-IW(1)、π\pi-IW(1)+和π\pi-HIW(n, 1)。此外,我们依据一些决定性特征对Atari-2600游戏进行了分类。该游戏分析进一步揭示了所引入算法的行为与性能。具体而言,对于具有大分支因子以及具有稀疏有意义奖励的游戏,N-CPL优于π\pi-IW、π\pi-IW(1)+和π\pi-HIW(n, 1)。

关键词

引用

@article{arxiv.2106.12151,
  title  = {Width-based Lookaheads with Learnt Base Policies and Heuristics Over the Atari-2600 Benchmark},
  author = {Stefan O'Toole and Nir Lipovetzky and Miquel Ramirez and Adrian Pearce},
  journal= {arXiv preprint arXiv:2106.12151},
  year   = {2021}
}