中文

基于历史策略学习以控制马尔可夫决策过程的研究

机器学习 2022-11-08 v1 系统与控制 系统与控制 机器学习

摘要

强化学习(RL)的经验共识表明,基于历史的函数近似方法(如循环神经网络或基于历史的状态抽象)优于其无记忆的对应方法,原因在于马尔可夫决策过程(MDP)中的函数近似可视为诱导出一个部分可观测 MDP。然而,对此类基于历史的算法尚缺乏形式化分析,因为大多数现有框架仅关注无记忆特征。本文引入一个理论框架,用于研究利用基于历史的特征抽象映射来学习控制 MDP 的 RL 算法的行为。此外,我们利用该框架设计了一种实用的 RL 算法,并在一组连续控制任务上对其有效性进行了数值评估。

关键词

引用

@article{arxiv.2211.03011,
  title  = {On learning history based policies for controlling Markov decision processes},
  author = {Gandharv Patil and Aditya Mahajan and Doina Precup},
  journal= {arXiv preprint arXiv:2211.03011},
  year   = {2022}
}