分层平均奖励线性可解马尔可夫决策过程
机器学习
2024-07-10 v1 人工智能
摘要
我们提出了一种针对线性可解马尔可夫决策过程(LMDPs)的分层强化学习新方法,适用于无限时限的平均奖励问题。与之前的工作不同,本方法允许同时学习低层和高层任务,且不对低层任务施加限制性条件。本方法依赖于状态空间的划分,这些划分创建更小的子任务,以便更高效地学习。我们进一步利用低层任务的组合性,精确地表示高层任务的值函数。实验表明,本方法相较于平坦平均奖励强化学习可提高一个或多个数量级。
引用
@article{arxiv.2407.06690,
title = {Hierarchical Average-Reward Linearly-solvable Markov Decision Processes},
author = {Guillermo Infante and Anders Jonsson and Vicenç Gómez},
journal= {arXiv preprint arXiv:2407.06690},
year = {2024}
}