批强化学习中三种正则化方法的比较与统一
机器学习
2021-09-17 v1 机器学习
摘要
在批强化学习中,可能存在探索不充分的状态-动作对,导致学习到的模型不准确、性能不佳。多种正则化方法可缓解马尔可夫决策过程(MDPs)中过复杂模型的学习问题,但它们在技术上与直观上运作方式不同,且缺乏可比较的共同形式。本文在统一框架——加权平均转移矩阵——中统一了三种正则化方法。以该共同形式考量正则化方法,阐明了 MDP 结构与批数据集的状态-动作对分布如何影响正则化方法的相对性能。我们通过在一系列 MDPs 与数据收集策略上的经验评估,确认了由该共同框架产生的直觉。
引用
@article{arxiv.2109.08134,
title = {Comparison and Unification of Three Regularization Methods in Batch Reinforcement Learning},
author = {Sarah Rathnam and Susan A. Murphy and Finale Doshi-Velez},
journal= {arXiv preprint arXiv:2109.08134},
year = {2021}
}
备注
ICML Workshop on Reinforcement Learning Theory 2021