吸收型 MDP 的极小极大权重学习
机器学习
2023-09-06 v2
摘要
强化学习策略评估问题常被建模为有限或折扣/平均无限 horizon MDP。本文研究吸收型 MDP 的无折扣离屏策略评估。给定由具有给定截断水平的独立同分布片段组成的数据集,我们提出一种称为 MWLA 的算法,通过状态-动作占用测度的重要性比率直接估计期望回报。研究了 MWLA 方法的均方误差(MSE)界,并分析了统计误差对数据大小和截断水平的依赖关系。在一个片段式出租车环境中,计算实验说明了 MWLA 算法的性能。
引用
@article{arxiv.2301.03183,
title = {Minimax Weight Learning for Absorbing MDPs},
author = {Fengyin Li and Yuqiang Li and Xianyi Wu},
journal= {arXiv preprint arXiv:2301.03183},
year = {2023}
}
备注
36 pages, 9 figures