中文

分层平均奖励线性可解马尔可夫决策过程

机器学习 2024-07-10 v1 人工智能

摘要

我们提出了一种针对线性可解马尔可夫决策过程(LMDPs)的分层强化学习新方法,适用于无限时限的平均奖励问题。与之前的工作不同,本方法允许同时学习低层和高层任务,且不对低层任务施加限制性条件。本方法依赖于状态空间的划分,这些划分创建更小的子任务,以便更高效地学习。我们进一步利用低层任务的组合性,精确地表示高层任务的值函数。实验表明,本方法相较于平坦平均奖励强化学习可提高一个或多个数量级。

引用

@article{arxiv.2407.06690,
  title  = {Hierarchical Average-Reward Linearly-solvable Markov Decision Processes},
  author = {Guillermo Infante and Anders Jonsson and Vicenç Gómez},
  journal= {arXiv preprint arXiv:2407.06690},
  year   = {2024}
}