策略梯度方法的时间离散不变安全动作重复
机器学习
2022-01-28 v6 人工智能
机器人学
摘要
在强化学习中,连续时间常由时间尺度 离散化,已知所得性能对其高度敏感。本工作中,我们寻求一种适用于策略梯度(PG)方法的 -不变算法,使其无论 取值如何均能表现良好。我们首先指出了导致 PG 方法在 时失败的根本原因,证明了在特定随机性假设下,PG 估计量的方差在随机环境中可发散至无穷。尽管持续动作或动作重复可用于实现 -不变性,但已有的动作重复方法无法在随机环境中对意外情况立即作出反应。为此,我们提出一种名为安全动作重复(SAR)的新型 -不变方法,可应用于任意现有 PG 算法。SAR 能在动作重复期间通过自适应响应状态变化来处理环境的随机性。我们通过实验证明,我们的方法不仅具有 -不变性,而且对随机性具有鲁棒性,在八个具有确定性与随机性设置的 MuJoCo 环境中均优于以往的 -不变方法。我们的代码见 https://vision.snu.ac.kr/projects/sar。
引用
@article{arxiv.2111.03941,
title = {Time Discretization-Invariant Safe Action Repetition for Policy Gradient Methods},
author = {Seohong Park and Jaekyeom Kim and Gunhee Kim},
journal= {arXiv preprint arXiv:2111.03941},
year = {2022}
}
备注
Accepted to NeurIPS 2021