面向稀疏奖励领域结构化探索的学习成就结构
机器学习
2023-05-02 v1 人工智能
摘要
我们提出了带成就的结构化探索(SEA),一种为多阶段强化学习算法设计的、面向基于成就的环境(一种具有内部成就集的特定类型环境)的算法。SEA首先利用离线数据通过行列式损失函数学习已知成就的表示,随后通过启发式算法恢复所学成就的依赖图,最后与环境在线交互,利用基于恢复的依赖图构建的控制器学习掌握已知成就并探索新成就的策略。我们通过实验证明,SEA能够准确恢复成就结构,并改善诸如Crafter等具有图像等高维观测且程序化生成的困难领域的探索。
引用
@article{arxiv.2305.00508,
title = {Learning Achievement Structure for Structured Exploration in Domains with Sparse Reward},
author = {Zihan Zhou and Animesh Garg},
journal= {arXiv preprint arXiv:2305.00508},
year = {2023}
}
备注
published as a conference paper at ICLR 2023