策略学习被高估了吗?:基于宽度的规划与主动学习在 Atari 上的应用
人工智能
2022-03-22 v2 机器学习
摘要
基于宽度的规划在使用像素输入的 Atari 2600 游戏上已展现出有前景的结果,同时使用的环境交互远少于强化学习。近期的基于宽度的方法使用手工设计特征集或在游戏画面上训练的变分自编码器(VAE-IW)为每个画面计算特征向量,并在搜索中剪枝不具有新颖特征的画面。我们提出 Olive(Online-VAE-IW),其通过主动学习在线更新 VAE 特征,以最大化规划期间所观测画面的效用。在 55 个 Atari 游戏中的实验结果表明,它以 42 比 11 优于 Rollout-IW,以 32 比 20 优于 VAE-IW。此外,Olive 以 30 比 22 和 31 比 17 优于基于策略学习(-IW、DQN)且以 100 倍训练预算训练的已有工作,并在 Atari 100k 基准上以 18 比 7 优于以相同训练预算训练且以 1.8 倍规划预算运行的先进数据高效强化学习(EfficientZero),且完全无需策略学习。源代码见 github.com/ibm/atari-active-learning。
引用
@article{arxiv.2109.15310,
title = {Is Policy Learning Overrated?: Width-Based Planning and Active Learning for Atari},
author = {Benjamin Ayton and Masataro Asai},
journal= {arXiv preprint arXiv:2109.15310},
year = {2022}
}
备注
Accepted in ICAPS 2022, Planning & Learning track. Edits: Title change. Fixed the variance update formula. Updated the scores of $\pi$-IW as per authors' request. Included the results of DQN and EfficientZero