中文

面向非平稳环境的带策略性退守的非参数随机策略梯度

机器人学 2022-03-29 v1 人工智能

摘要

在现代机器人学中,在动态变化环境下有效计算最优控制策略对现成的参数化策略梯度方法(如深度确定性策略梯度(DDPG)和双延迟深度确定性策略梯度(TD3))提出了重大挑战。本文中,我们提出一种系统化方法,以非参数方式动态学习一系列最优控制策略,同时自主适应持续变化的环境动态。具体而言,我们基于核的非参数方法将策略分布嵌入为非递减欧几里得空间中的特征,从而将其搜索空间定义为非常高(可能无限)维的 RKHS(再生核希尔伯特空间)。此外,通过利用 RKHS 中计算的相似性度量,我们以 AdaptiveH 技术增强非参数学习——自适应地选取一个时间帧窗口,用于完成在某些先前观测状态上采样得到的整个动作序列的最优部分。为验证所提方法,我们在多个经典基准及一个配备动态变化环境的模拟机器人基准上进行了大量实验。总体而言,我们的方法在学习性能上以可观优势超越了成熟的 DDPG 与 TD3 方法。

关键词

引用

@article{arxiv.2203.14905,
  title  = {Non-Parametric Stochastic Policy Gradient with Strategic Retreat for Non-Stationary Environment},
  author = {Apan Dastider and Mingjie Lin},
  journal= {arXiv preprint arXiv:2203.14905},
  year   = {2022}
}

备注

Submitted to CASE 2022