基于最优控制的策略梯度方法引导式探索基线
机器学习
2024-11-07 v5 人工智能
机器人学
系统与控制
系统与控制
摘要
本文提出一种新颖的基于最优控制的基线函数,用于深度强化学习(RL)中的策略梯度方法。该基线通过求解一个与 RL 任务紧密关联的最优控制问题的值函数获得。与旨在降低策略梯度估计方差的传统基线不同,我们的工作利用最优控制值函数为基线的角色引入新维度——在策略学习过程中提供引导式探索。这一方面在既往工作中较少讨论。我们在机器人学习任务上验证所提基线,显示其在引导式探索尤其是稀疏奖励环境中的有效性。
引用
@article{arxiv.2011.02073,
title = {Optimal Control-Based Baseline for Guided Exploration in Policy Gradient Methods},
author = {Xubo Lyu and Site Li and Seth Siriya and Ye Pu and Mo Chen},
journal= {arXiv preprint arXiv:2011.02073},
year = {2024}
}