在值函数中输入策略如何:策略表示与策略扩展值函数近似器
机器学习
2021-12-16 v4 人工智能
摘要
我们研究强化学习(RL)中的策略扩展值函数近似器(PeVFA),它将传统的值函数近似器(VFA)扩展为不仅以状态(和动作)而且以显式策略表示为输入。这种扩展使PeVFA能够同时保留多个策略的值,并带来一个引人注目的特性,即\emph{策略间的值泛化}。我们在广义策略迭代(GPI)下形式化分析了该值泛化。从理论和经验视角,我们表明PeVFA提供的广义值估计对连续策略真实值的初始近似误差可能更低,这有望改善GPI期间的连续值近似。基于上述线索,我们引入了一种利用沿策略改进路径的值泛化的带PeVFA的GPI新形式。此外,我们提出了一种RL策略的表示学习框架,提供了几种从策略网络参数或状态-动作对中学习有效策略嵌入的方法。在我们的实验中,我们在多个OpenAI Gym连续控制任务中评估了PeVFA所提供的值泛化及策略表示学习的功效。作为算法实现的一个代表性实例,在带PeVFA的GPI范式下重新实现的近端策略优化(PPO)在大多数环境中相比其原始版本取得了约40%的性能提升。
引用
@article{arxiv.2010.09536,
title = {What About Inputing Policy in Value Function: Policy Representation and Policy-extended Value Function Approximator},
author = {Hongyao Tang and Zhaopeng Meng and Jianye Hao and Chen Chen and Daniel Graves and Dong Li and Changmin Yu and Hangyu Mao and Wulong Liu and Yaodong Yang and Wenyuan Tao and Li Wang},
journal= {arXiv preprint arXiv:2010.09536},
year = {2021}
}
备注
Accepted as a conference paper on AAAI 2022