基于强化学习的无模型自主水下航行器深度控制
机器人学
2017-11-23 v1
摘要
本文研究自主水下航行器(AUV)跟踪期望深度轨迹的深度控制问题。由于 AUV 动力学模型未知,多数基于模型的控制器无法解决这些问题。为此,我们将 AUV 的深度控制问题表述为转移概率未知下的连续状态、连续动作马尔可夫决策过程(MDPs)。基于确定性策略梯度(DPG)与神经网络逼近,我们提出一种无模型强化学习(RL)算法,从 AUV 的采样轨迹中学习状态反馈控制器。为提升 RL 算法性能,我们进一步提出一种通过回放先前优先轨迹的批量学习方案。仿真表明,我们的无模型方法甚至可与 LQI 和 NMPC 等基于模型的控制器相媲美。此外,我们在中国南海采样的海底数据集上验证了所提 RL 算法的有效性。
引用
@article{arxiv.1711.08224,
title = {Depth Control of Model-Free AUVs via Reinforcement Learning},
author = {Hui Wu and Shiji Song and Keyou You and Cheng Wu},
journal= {arXiv preprint arXiv:1711.08224},
year = {2017}
}