中文

用于扰动衰减的鲁棒确定性策略梯度及其在四旋翼控制中的应用

机器人学 2025-12-04 v6 人工智能

摘要

本文提出了一种称为鲁棒确定性策略梯度(RDPG)的鲁棒强化学习算法,该算法将 HH_\infty 控制问题重新表述为用户与对手之间的两人零和动态博弈。该方法将确定性策略梯度与深度强化学习相结合,以训练能够有效衰减扰动的鲁棒策略。一种实用变体,即鲁棒深度确定性策略梯度(RDDPG),集成了双延迟更新以提高稳定性和样本效率。在无人机上的实验表明,在严重扰动条件下具有卓越的鲁棒性和跟踪精度。

关键词

引用

@article{arxiv.2502.21057,
  title  = {Robust Deterministic Policy Gradient for Disturbance Attenuation and Its Application to Quadrotor Control},
  author = {Taeho Lee and Donghwan Lee},
  journal= {arXiv preprint arXiv:2502.21057},
  year   = {2025}
}

备注

8 pages