中文

方差惩罚的 On-Policy 与 Off-Policy 演员-评论家算法

机器学习 2021-02-04 v1 人工智能

摘要

强化学习算法通常旨在优化智能体的期望回报。然而,在许多实际应用中,需要回报的低方差以确保算法的可靠性。在本文中,我们提出on-policy和off-policy演员-评论家算法,它们优化涉及回报中均值与方差的性能准则。先前工作使用回报的二阶矩来间接估计方差。相反,我们使用一种更简单的近期提出的直接方差估计器,其利用时序差分方法增量更新估计。利用方差惩罚准则,我们保证了算法在有限状态动作马尔可夫决策过程中收敛到局部最优策略。我们在表格化与连续MuJoCo域中展示了我们算法的效用。我们的方法不仅在期望回报方面与演员-评论家及先前的方差惩罚基线表现相当,而且生成具有更低回报方差的轨迹。

关键词

引用

@article{arxiv.2102.01985,
  title  = {Variance Penalized On-Policy and Off-Policy Actor-Critic},
  author = {Arushi Jain and Gandharv Patil and Ayush Jain and Khimya Khetarpal and Doina Precup},
  journal= {arXiv preprint arXiv:2102.01985},
  year   = {2021}
}

备注

Accepted to the Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-21), 2021