中文

分层强化学习中利用多子目标实现快速探索

机器学习 2019-05-15 v1 人工智能 机器学习

摘要

分层强化学习(HRL)利用时间扩展动作(即选项)从更高维视角进行决策,以缓解稀疏奖励问题——强化学习中最具挑战性的问题之一。现有大多数 HRL 算法要么需要针对特定环境的大量人工设计,要么需要海量探索以从数据中自动学习选项。为在不使用人工设计的情况下实现快速探索,我们设计了一种多目标 HRL 算法,由高层策略 Manager 和低层策略 Worker 组成。Manager 在每个时间步为 Worker 提供多个子目标。每个子目标对应一个用于控制环境的选项。尽管智能体在训练初期可能因受三个不同子目标引导而表现出一定混乱,但其行为策略将快速学会在不同情形下如何响应来自高层控制器的多个子目标。通过利用多个子目标,探索效率得到显著提升。我们在 Atari 的 Montezuma's Revenge 环境(一个知名的稀疏奖励环境)中进行实验,以远低于前沿 HRL 方法的训练时间成本取得了与之相当的性能。

关键词

引用

@article{arxiv.1905.05180,
  title  = {Learning and Exploiting Multiple Subgoals for Fast Exploration in Hierarchical Reinforcement Learning},
  author = {Libo Xing},
  journal= {arXiv preprint arXiv:1905.05180},
  year   = {2019}
}