基于历史策略学习以控制马尔可夫决策过程的研究
机器学习
2022-11-08 v1 系统与控制
系统与控制
机器学习
摘要
强化学习(RL)的经验共识表明,基于历史的函数近似方法(如循环神经网络或基于历史的状态抽象)优于其无记忆的对应方法,原因在于马尔可夫决策过程(MDP)中的函数近似可视为诱导出一个部分可观测 MDP。然而,对此类基于历史的算法尚缺乏形式化分析,因为大多数现有框架仅关注无记忆特征。本文引入一个理论框架,用于研究利用基于历史的特征抽象映射来学习控制 MDP 的 RL 算法的行为。此外,我们利用该框架设计了一种实用的 RL 算法,并在一组连续控制任务上对其有效性进行了数值评估。
引用
@article{arxiv.2211.03011,
title = {On learning history based policies for controlling Markov decision processes},
author = {Gandharv Patil and Aditya Mahajan and Doina Precup},
journal= {arXiv preprint arXiv:2211.03011},
year = {2022}
}