中文

用于离线强化学习的投影状态-动作平衡权重

机器学习 2022-06-13 v2 统计方法学

摘要

离线策略评估 (OPE) 被认为是强化学习 (RL) 中一个基础且具挑战性的问题。本文在无限时域 Markov 决策过程的框架下,重点关注基于由可能不同的策略生成的预收集数据对目标策略进行价值估计。受 RL 中最近开发的边际重要性采样方法和因果推断中的协变量平衡思想的启发,我们提出了一种具有近似投影状态-动作平衡权重的新型估计器,用于策略价值估计。我们获得了这些权重的收敛速度,并证明了在技术条件下所提出价值估计器具有半参数有效性。在渐近性方面,我们的结果随轨迹数量和每条轨迹的决策点数量同时扩展。因此,当决策点数量发散时,即使受试者数量有限也能实现一致性。此外,我们建立了在 off-policy 设定下 Bellman 算子适定性的充分必要条件,这刻画了 OPE 的难度,可能具有独立的意义。数值实验证明了我们提出的估计器具有良好的性能。

关键词

引用

@article{arxiv.2109.04640,
  title  = {Projected State-action Balancing Weights for Offline Reinforcement Learning},
  author = {Jiayi Wang and Zhengling Qi and Raymond K. W. Wong},
  journal= {arXiv preprint arXiv:2109.04640},
  year   = {2022}
}