中文

策略梯度方法的时间离散不变安全动作重复

机器学习 2022-01-28 v6 人工智能 机器人学

摘要

在强化学习中,连续时间常由时间尺度 δ\delta 离散化,已知所得性能对其高度敏感。本工作中,我们寻求一种适用于策略梯度(PG)方法的 δ\delta-不变算法,使其无论 δ\delta 取值如何均能表现良好。我们首先指出了导致 PG 方法在 δ0\delta \to 0 时失败的根本原因,证明了在特定随机性假设下,PG 估计量的方差在随机环境中可发散至无穷。尽管持续动作或动作重复可用于实现 δ\delta-不变性,但已有的动作重复方法无法在随机环境中对意外情况立即作出反应。为此,我们提出一种名为安全动作重复(SAR)的新型 δ\delta-不变方法,可应用于任意现有 PG 算法。SAR 能在动作重复期间通过自适应响应状态变化来处理环境的随机性。我们通过实验证明,我们的方法不仅具有 δ\delta-不变性,而且对随机性具有鲁棒性,在八个具有确定性与随机性设置的 MuJoCo 环境中均优于以往的 δ\delta-不变方法。我们的代码见 https://vision.snu.ac.kr/projects/sar。

关键词

引用

@article{arxiv.2111.03941,
  title  = {Time Discretization-Invariant Safe Action Repetition for Policy Gradient Methods},
  author = {Seohong Park and Jaekyeom Kim and Gunhee Kim},
  journal= {arXiv preprint arXiv:2111.03941},
  year   = {2022}
}

备注

Accepted to NeurIPS 2021