概率推断用于欠驱动自主水下航行器学习控制适用性的探索
系统与控制
2021-01-14 v1 系统与控制
摘要
水下航行器被用于探索动态环境,而为每项任务调参特定控制器既耗时又不可靠,因为控制器依赖于理想化条件下计算出的数学系数。对于此类情形,从经验中学习任务可作为一种有用的替代方案。本文探索了概率推断学习控制自主水下航行器的能力,该能力可用于不同任务而无需重新编程控制器。概率推断学习利用真实航行器的高斯过程模型,通过少量真实现场实验学习正确策略。概率强化学习的使用寻求控制器的简单实现,免去了系数计算、控制器调参或系统辨识的负担。采用一系列计算仿真测试了基于模型的强化学习在水下航行器中的适用性。评估了三种仿真场景:航点跟踪、深度控制与 3D 路径跟踪控制。3D 路径跟踪通过将视线法与概率推断学习控制耦合完成。作为对比研究,LOS-PILCO 算法可优于鲁棒 LOS-PID。结果表明,基于概率模型的强化学习是欠驱动 AUV 运动控制的一种可行方案,因其能以最少回合生成有能力策略。
引用
@article{arxiv.1912.11584,
title = {Exploration of the Applicability of Probabilistic Inference for Learning Control in Underactuated Autonomous Underwater Vehicles},
author = {Wilmer Ariza Ramirez and Zhi Q. Leong and Hung D. Nguyen and S. G. Jayasinghe},
journal= {arXiv preprint arXiv:1912.11584},
year = {2021}
}