中文

SAGE:为深度强化学习中的短视模型生成符号目标

机器学习 2022-03-11 v1 人工智能

摘要

基于模型的强化学习算法通常比无模型的对应算法具有更高的样本效率,尤其是在稀疏奖励问题中。遗憾的是,许多有趣的领域过于复杂,难以指定传统基于模型方法所需的完整模型。学习一个模型需要大量环境样本,并且如果环境难以探索,可能无法捕获关键信息。如果我们能够指定一个不完整的模型并让智能体学习如何最佳地使用它,我们便可以利用对许多领域的部分理解。现有的解决此问题的混合规划与学习系统通常对可使用的模型种类施加高度限制性假设,限制了其在广泛领域的适用性。在这项工作中,我们提出 SAGE,一种结合学习与规划以利用一类先前无法使用的不完整模型的算法。它以一种新颖的方式结合了符号规划与神经学习方法的优势,在 taxi world 和 Minecraft 的变体上优于竞争方法。

关键词

引用

@article{arxiv.2203.05079,
  title  = {SAGE: Generating Symbolic Goals for Myopic Models in Deep Reinforcement Learning},
  author = {Andrew Chester and Michael Dann and Fabio Zambetta and John Thangarajah},
  journal= {arXiv preprint arXiv:2203.05079},
  year   = {2022}
}

备注

11 pages, 8 figures, 3 tables