基于宽度的前瞻结合习得基策略与启发式方法在Atari-2600基准上的表现
人工智能
2021-10-29 v2
摘要
我们提出了新的基于宽度的规划与学习算法,其灵感来源于对先前基于宽度的规划器所做设计决策的细致分析。这些算法应用于Atari-2600游戏,而我们性能最佳的算法——新颖性引导的关键路径学习(N-CPL),优于先前引入的基于宽度的规划与学习算法-IW(1)、-IW(1)+和-HIW(n, 1)。此外,我们依据一些决定性特征对Atari-2600游戏进行了分类。该游戏分析进一步揭示了所引入算法的行为与性能。具体而言,对于具有大分支因子以及具有稀疏有意义奖励的游戏,N-CPL优于-IW、-IW(1)+和-HIW(n, 1)。
引用
@article{arxiv.2106.12151,
title = {Width-based Lookaheads with Learnt Base Policies and Heuristics Over the Atari-2600 Benchmark},
author = {Stefan O'Toole and Nir Lipovetzky and Miquel Ramirez and Adrian Pearce},
journal= {arXiv preprint arXiv:2106.12151},
year = {2021}
}