中文

基于鲁棒MPC的确定性策略梯度偏差校正

系统与控制 2021-04-07 v1 系统与控制

摘要

在本文中,我们讨论基于线性兼容优势函数近似器的 Actor-Critic 方法下的确定性策略梯度,其中输入空间是连续的。当策略受硬约束限制时,探索可能非中心或非各向同性(非 CI)。因此,策略梯度估计可能存在偏差。我们聚焦于基于模型预测控制(MPC)方案的约束策略,并为解决偏差问题,提出一种考虑探索的近似鲁棒 MPC(RMPC)方法。基于 RMPC 的策略确保中心且各向同性(CI)探索近似可行。使用后验投影来保证其精确可行性,我们形式化地证明该方法不会使梯度估计产生偏差。

关键词

引用

@article{arxiv.2104.02413,
  title  = {Bias Correction in Deterministic Policy Gradient Using Robust MPC},
  author = {Arash Bahari Kordabad and Hossein Nejatbakhsh Esfahani and Sebastien Gros},
  journal= {arXiv preprint arXiv:2104.02413},
  year   = {2021}
}

备注

This paper has been accepted to ECC 2021. 6 pages