中文

折扣正则化的意外后果:改进确定性等价强化学习中的正则化

机器学习 2023-06-21 v1 人工智能 机器学习

摘要

折扣正则化(在计算最优策略时使用较短的规划视野)是一种流行选择,用于在从稀疏或噪声数据估计MDP时,将规划限制为较不复杂的策略集合(Jiang et al., 2015)。通常认为折扣正则化通过淡化或忽略延迟效应来发挥作用。在本文中,我们揭示了折扣正则化的另一种视角,暴露了其意外后果。我们证明,在较低折扣因子下规划产生的最优策略,与使用任意在状态和动作上具有相同分布的转移矩阵先验进行规划所产生的最优策略完全相同。事实上,它类似于一个对具有更多转移数据的状态-动作对施加更强正则化的先验。当转移矩阵是从各状态-动作对数据量不均衡的数据集估计时,这会导致糟糕的性能。我们的等价定理得出了一个显式公式,用于为单个状态-动作对局部而非全局地设置正则化参数。我们在简单经验示例以及医疗癌症模拟器中展示了折扣正则化的失败,以及我们如何使用状态-动作特定的方法来补救它们。

关键词

引用

@article{arxiv.2306.11208,
  title  = {The Unintended Consequences of Discount Regularization: Improving Regularization in Certainty Equivalence Reinforcement Learning},
  author = {Sarah Rathnam and Sonali Parbhoo and Weiwei Pan and Susan A. Murphy and Finale Doshi-Velez},
  journal= {arXiv preprint arXiv:2306.11208},
  year   = {2023}
}