基于多重伪Q学习的确定性策略梯度方法用于自主水下航行器跟踪控制
机器学习
2019-09-10 v1 人工智能
机器学习
摘要
本文研究一类具有未知动力学和约束输入的欠驱动自主水下航行器(AUV)的轨迹跟踪问题。不同于现有采用单一行动器-评判器但无法实现满意跟踪控制精度和稳定学习的策略梯度方法,我们提出的算法通过应用混合行动器-评判器架构,能够实现AUV的高水平跟踪控制精度和稳定学习,其中多个行动器和评判器分别被训练以学习确定性策略和行动值函数。具体而言,对于评判器,采用基于期望绝对贝尔曼误差的更新规则,在每个时间步选择最差的评判器进行更新。随后,为了为所选评判器计算具有更准确目标值的损失函数,针对连续动作空间开发了伪Q学习(Pseudo Q-learning),它使用次贪婪策略替代Q学习中的贪婪策略,并提出多重伪Q学习(MPQ)以减少行动值函数的高估并稳定学习。对于行动器,应用确定性策略梯度更新权重,最终学到的策略定义为所有行动器的平均值,以避免大幅但不良的更新。此外,定性地给出了学习的稳定性分析。所提出的基于MPQ的确定性策略梯度(MPQ-DPG)算法的有效性和通用性,通过在具有两条不同参考轨迹的AUV上的应用得到验证。结果证明了MPQ-DPG的高水平跟踪控制精度和稳定学习。此外,结果还验证了增加行动器和评判器的数量将进一步改善性能。
引用
@article{arxiv.1909.03204,
title = {Multi Pseudo Q-learning Based Deterministic Policy Gradient for Tracking Control of Autonomous Underwater Vehicles},
author = {Wenjie Shi and Shiji Song and Cheng Wu and C. L. Philip Chen},
journal= {arXiv preprint arXiv:1909.03204},
year = {2019}
}
备注
IEEE Transactions on Neural Networks and Learning Systems