中文

吸收型 MDP 的极小极大权重学习

机器学习 2023-09-06 v2

摘要

强化学习策略评估问题常被建模为有限或折扣/平均无限 horizon MDP。本文研究吸收型 MDP 的无折扣离屏策略评估。给定由具有给定截断水平的独立同分布片段组成的数据集,我们提出一种称为 MWLA 的算法,通过状态-动作占用测度的重要性比率直接估计期望回报。研究了 MWLA 方法的均方误差(MSE)界,并分析了统计误差对数据大小和截断水平的依赖关系。在一个片段式出租车环境中,计算实验说明了 MWLA 算法的性能。

关键词

引用

@article{arxiv.2301.03183,
  title  = {Minimax Weight Learning for Absorbing MDPs},
  author = {Fengyin Li and Yuqiang Li and Xianyi Wu},
  journal= {arXiv preprint arXiv:2301.03183},
  year   = {2023}
}

备注

36 pages, 9 figures