从随机深度动作条件预测中学习状态表示
机器学习
2021-11-09 v2 人工智能
摘要
我们在本工作中的主要贡献是一项经验发现:随机通用值函数(GVFs),即深度动作条件预测——无论在其所预测的观测特征方面,还是在其所条件依赖的动作序列方面均为随机——构成了强化学习(RL)问题的良好辅助任务。具体而言,我们表明,当用作辅助任务时,随机深度动作条件预测所产生的状态表示,在 Atari 与 DeepMind Lab 任务中,其控制性能可与最先进的精心设计的辅助任务(如值预测、像素控制和 CURL)相竞争。在另一组实验中,我们阻断从网络 RL 部分到状态表示学习部分的梯度,并表明——或许令人惊讶——仅辅助任务就足以学习到优于端到端训练的 actor-critic 基线的状态表示。我们的代码已开源:https://github.com/Hwhitetooth/random_gvfs。
引用
@article{arxiv.2102.04897,
title = {Learning State Representations from Random Deep Action-conditional Predictions},
author = {Zeyu Zheng and Vivek Veeriah and Risto Vuorio and Richard Lewis and Satinder Singh},
journal= {arXiv preprint arXiv:2102.04897},
year = {2021}
}
备注
NeurIPS 2021