中文

分层强化学习中的规划:使用局部策略的保证

机器学习 2020-01-06 v2 人工智能 数据结构与算法

摘要

我们考虑分层强化学习的一种设定,其中奖励是若干分量之和。对于每个分量,给定最大化该分量的策略,我们的目标是由这些个体策略组装出一个最大化分量之和的策略。我们针对具有可收集奖励的确定性 MDP 提供组装此类策略的理论保证。我们的方法基于将该问题表述为带折扣奖励的行商问题。我们关注局部解,即仅使用当前状态信息的策略;因此,它们易于实现且不需要大量计算资源。我们提出三种局部随机策略,并证明它们在最坏情况下保证优于任何确定性局部策略;实验结果表明它们在平均意义上也表现更好。

关键词

引用

@article{arxiv.1902.10140,
  title  = {Planning in Hierarchical Reinforcement Learning: Guarantees for Using Local Policies},
  author = {Tom Zahavy and Avinatan Hasidim and Haim Kaplan and Yishay Mansour},
  journal= {arXiv preprint arXiv:1902.10140},
  year   = {2020}
}

备注

Extends previous paper (arXiv:1803.04674) by the same authors