中文

通过状态保守策略优化学习抗转移动力学扰动的鲁棒策略

机器学习 2021-12-21 v1 机器学习

摘要

深度强化学习算法由于源环境与目标环境之间的差异,在真实世界任务中表现可能很差。该差异通常被视为转移动力学中的扰动。许多现有算法通过在训练中建模扰动并将其应用于源环境来学习鲁棒策略,这通常需要关于扰动的先验知识以及对模拟器的控制。然而,这些算法在目标环境扰动未知或在模拟器中难以建模的场景下会失效。为解决此问题,我们提出一种新颖的无模型 actor-critic 算法——即状态保守策略优化(SCPO)——以在无需预先建模扰动的情况下学习鲁棒策略。具体而言,SCPO 将转移动力学中的扰动归约为状态空间中的扰动,随后通过简单的基于梯度的正则化项对其进行近似。SCPO 的突出特点包括实现简单,且不需要关于扰动的额外知识或专门设计的模拟器。在若干机器人控制任务中的实验表明,SCPO 学习到了抗转移动力学扰动的鲁棒策略。

关键词

引用

@article{arxiv.2112.10513,
  title  = {Learning Robust Policy against Disturbance in Transition Dynamics via State-Conservative Policy Optimization},
  author = {Yufei Kuang and Miao Lu and Jie Wang and Qi Zhou and Bin Li and Houqiang Li},
  journal= {arXiv preprint arXiv:2112.10513},
  year   = {2021}
}

备注

Accepted to AAAI 2022