中文

批强化学习中三种正则化方法的比较与统一

机器学习 2021-09-17 v1 机器学习

摘要

在批强化学习中,可能存在探索不充分的状态-动作对,导致学习到的模型不准确、性能不佳。多种正则化方法可缓解马尔可夫决策过程(MDPs)中过复杂模型的学习问题,但它们在技术上与直观上运作方式不同,且缺乏可比较的共同形式。本文在统一框架——加权平均转移矩阵——中统一了三种正则化方法。以该共同形式考量正则化方法,阐明了 MDP 结构与批数据集的状态-动作对分布如何影响正则化方法的相对性能。我们通过在一系列 MDPs 与数据收集策略上的经验评估,确认了由该共同框架产生的直觉。

关键词

引用

@article{arxiv.2109.08134,
  title  = {Comparison and Unification of Three Regularization Methods in Batch Reinforcement Learning},
  author = {Sarah Rathnam and Susan A. Murphy and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:2109.08134},
  year   = {2021}
}

备注

ICML Workshop on Reinforcement Learning Theory 2021