通过自博弈学习目标嵌入用于分层强化学习
机器学习
2018-11-26 v1 机器学习
摘要
在分层强化学习中,一个主要挑战是确定合适的底层策略。我们提出了一种无监督学习方案,基于 Sukhbaatar 等人(2018)的非对称自博弈,自动学习环境中子目标的好表征以及可执行这些子目标的底层策略。高层策略随后可通过生成连续子目标向量序列来指导底层策略。我们使用 Mazebase 和 Mujoco 环境(包括具有挑战性的 AntGather 任务)评估我们的模型。子目标嵌入的可视化揭示了环境中任务的逻辑分解。在数量上,我们的方法相对于非分层方法获得了引人注目的性能提升。
引用
@article{arxiv.1811.09083,
title = {Learning Goal Embeddings via Self-Play for Hierarchical Reinforcement Learning},
author = {Sainbayar Sukhbaatar and Emily Denton and Arthur Szlam and Rob Fergus},
journal= {arXiv preprint arXiv:1811.09083},
year = {2018}
}