在可微物理仿真中利用奖励梯度进行强化学习
机器学习
2022-03-08 v1 机器人学
系统与控制
系统与控制
摘要
近年来,全可微刚体物理仿真器已被开发,可用于模拟广泛的机器人系统。在控制的强化学习背景下,这些仿真器在理论上允许算法直接应用于奖励函数的解析梯度。然而,迄今这些梯度被证明极难使用,且被完全不利用梯度信息的算法所超越。本工作中我们提出一种新颖算法——交叉熵解析策略梯度,能够利用这些梯度,在一组具有挑战性的非线性控制问题上优于最先进的深度强化学习。
引用
@article{arxiv.2203.02857,
title = {Leveraging Reward Gradients For Reinforcement Learning in Differentiable Physics Simulations},
author = {Sean Gillen and Katie Byl},
journal= {arXiv preprint arXiv:2203.02857},
year = {2022}
}