通过奖励塑形在情节式强化学习中利用多种抽象层
机器学习
2023-08-07 v2 人工智能
摘要
强化学习(RL)应用于许多实际领域的一个主要限制是学习最优策略所需的大量样本。为解决此问题并提高学习效率,我们考虑目标领域底层马尔可夫决策过程(MDP)的线性抽象层层级。每一层是一个 MDP,表示层级中紧邻其下层的更粗粒度模型。本工作中,我们提出一种新颖的奖励塑形形式,其中在抽象层获得的解被用来为更具体的 MDP 提供奖励,使得抽象解引导更复杂领域中的学习。与分层 RL 中的其他工作不同,我们的技术在抽象模型设计上要求很少,并且对建模误差具有容忍度,从而使所提方法实用。我们形式化分析了抽象模型与低层领域诱导的探索启发式之间的关系。此外,我们证明该方法保证最优收敛,并通过实验展示其有效性。
引用
@article{arxiv.2303.00516,
title = {Exploiting Multiple Abstractions in Episodic RL via Reward Shaping},
author = {Roberto Cipollone and Giuseppe De Giacomo and Marco Favorito and Luca Iocchi and Fabio Patrizi},
journal= {arXiv preprint arXiv:2303.00516},
year = {2023}
}
备注
This is an extended version of the paper presented at AAAI 2023, https://doi.org/10.1609/aaai.v37i6.25881