中文

HAC Explore:利用分层强化学习加速探索

人工智能 2021-08-13 v1

摘要

稀疏奖励与长时间跨度对强化学习算法而言仍是挑战。探索奖励可通过鼓励智能体探索状态空间而在稀疏奖励设置中提供帮助,而分层方法可通过将冗长任务分解为较短子任务来辅助长时间跨度任务。我们提出HAC Explore (HACx),一种将探索奖励方法Random Network Distillation (RND)整合进分层方法Hierarchical Actor-Critic (HAC)的新方法,结合了上述两类方法。在一组困难的模拟机器人任务中,HACx优于任一单独组件方法,以及一种已有的结合分层与探索的方法。HACx是首个解决需要超过1000个动作的稀疏奖励连续控制任务的RL方法。

关键词

引用

@article{arxiv.2108.05872,
  title  = {HAC Explore: Accelerating Exploration with Hierarchical Reinforcement Learning},
  author = {Willie McClinton and Andrew Levy and George Konidaris},
  journal= {arXiv preprint arXiv:2108.05872},
  year   = {2021}
}