用于扰动衰减的鲁棒确定性策略梯度及其在四旋翼控制中的应用
机器人学
2025-12-04 v6 人工智能
摘要
本文提出了一种称为鲁棒确定性策略梯度(RDPG)的鲁棒强化学习算法,该算法将 控制问题重新表述为用户与对手之间的两人零和动态博弈。该方法将确定性策略梯度与深度强化学习相结合,以训练能够有效衰减扰动的鲁棒策略。一种实用变体,即鲁棒深度确定性策略梯度(RDDPG),集成了双延迟更新以提高稳定性和样本效率。在无人机上的实验表明,在严重扰动条件下具有卓越的鲁棒性和跟踪精度。
引用
@article{arxiv.2502.21057,
title = {Robust Deterministic Policy Gradient for Disturbance Attenuation and Its Application to Quadrotor Control},
author = {Taeho Lee and Donghwan Lee},
journal= {arXiv preprint arXiv:2502.21057},
year = {2025}
}
备注
8 pages