中文

强化学习中鲁棒策略评估的在线估计与推断

机器学习 2025-03-04 v2 机器学习

摘要

强化学习已成为现代统计学习中备受关注的重要主题之一,而策略评估是其关键组成部分。与关于该主题的传统机器学习文献不同,我们的工作强调对强化学习算法的模型参数与值函数进行统计推断。尽管大多数现有分析假设随机奖励服从标准分布,我们通过在统一框架内同时处理离群值污染与重尾奖励问题,将鲁棒统计的概念引入强化学习。在本文中,我们开发了完全在线的鲁棒策略评估过程,并建立了我们估计量的 Bahadur 型表示。此外,我们开发了基于渐近分布高效进行统计推断的在线过程。本文连接了强化学习中的鲁棒统计与统计推断,为在线策略评估提供了更具通用性与可靠性的方法。最后,我们通过仿真与真实世界强化学习实验中的数值实验验证了算法的有效性。

关键词

引用

@article{arxiv.2310.02581,
  title  = {Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning},
  author = {Weidong Liu and Jiyuan Tu and Xi Chen and Yichen Zhang},
  journal= {arXiv preprint arXiv:2310.02581},
  year   = {2025}
}

备注

68 pages, 38 figures