中文

基于瞬态与 recurrent 状态的近似无折扣策略评估

机器学习 2022-04-12 v1

摘要

为区分在瞬态状态中指定好动作与坏动作的策略,我们需要从瞬态状态评估所谓策略的偏差。然而我们观察到,迄今为止大多数(即便不是全部)近似无折扣策略评估的工作都仅用于从recurrent状态估计偏差。因此我们提出一套从瞬态与recurrent状态估计偏差(具体为其相对值)的近似器系统。其关键要素是一种半范数LSTD(最小二乘时序差分),我们推导了其最小化表达式,从而能够在无模型强化学习所需采样下进行近似。该半范数LSTD也促进了基于LSTD的策略值近似器通用统一过程的公式化。实验结果验证了所提方法的有效性。

关键词

引用

@article{arxiv.2204.04324,
  title  = {Approximate discounting-free policy evaluation from transient and recurrent states},
  author = {Vektor Dewanto and Marcus Gallagher},
  journal= {arXiv preprint arXiv:2204.04324},
  year   = {2022}
}

备注

28 pages