利用值函数搜索改进深度策略梯度
机器学习
2023-02-21 v1 人工智能
摘要
深度策略梯度(PG)算法采用值网络来驱动参数化策略的学习并降低梯度估计的方差。然而,值函数逼近会陷入局部最优且难以拟合实际回报,限制了方差缩减效能并导致策略性能次优。本文聚焦于改进值逼近并分析其对深度 PG 基本要素(如值预测、方差缩减以及梯度估计与真实梯度的相关性)的影响。为此,我们引入一种值函数搜索,利用一组扰动的值网络来搜索更好的逼近。我们的框架不需要额外的环境交互、梯度计算或集成,提供了一种计算代价低廉的方法来增强值网络所训练的监督学习任务。关键的是,我们表明改进深度 PG 基本要素可在常用连续控制基准域上带来更高的样本效率与更高回报的策略。
引用
@article{arxiv.2302.10145,
title = {Improving Deep Policy Gradients with Value Function Search},
author = {Enrico Marchesini and Christopher Amato},
journal= {arXiv preprint arXiv:2302.10145},
year = {2023}
}
备注
Accepted at The Eleventh International Conference on Learning Representations (ICLR)