基于参数的价值函数
机器学习
2021-08-16 v4 人工智能
机器学习
摘要
传统的离策略actor-critic强化学习(RL)算法学习单一目标策略的价值函数。然而,当价值函数被更新以跟踪所学策略时,它们会遗忘关于旧策略的潜在有用信息。我们引入一类称为基于参数的价值函数(PBVFs)的价值函数,其输入包含策略参数。它们可跨不同策略泛化。PBVFs可在给定状态、状态-动作对或RL智能体初始状态分布的情况下评估任意策略的性能。首先我们展示PBVFs如何产生新颖的离策略策略梯度定理。然后我们推导基于由蒙特卡洛或时序差分方法训练的PBVFs的离策略actor-critic算法。我们展示学到的PBVFs如何零样本学习优于训练期间所见任何策略的新策略。最后,我们的算法在一系列离散与连续控制任务上使用浅层策略与深度神经网络进行评估,其性能可与最先进方法相媲美。
引用
@article{arxiv.2006.09226,
title = {Parameter-Based Value Functions},
author = {Francesco Faccio and Louis Kirsch and Jürgen Schmidhuber},
journal= {arXiv preprint arXiv:2006.09226},
year = {2021}
}
备注
Published as a conference paper at ICLR 2021