基于 Lyapunov 奖励塑形的移动机器人自适应 LSAC-PID 方法
机器人学
2021-11-04 v1 系统与控制
系统与控制
摘要
为解决多输入多输出 (MIMO) PID 控制系统中控制回路的耦合问题以及参数自适应整定问题,本文提出一种基于深度强化学习 (RL) 和基于 Lyapunov 的奖励塑形的自适应 LSAC-PID 算法。针对复杂未知的机器人移动控制环境,首先提出一种基于 RL 的 MIMO PID 混合控制策略。根据移动机器人的动态信息和环境反馈,RL 智能体可实时输出最优 MIMO PID 参数,而无需知道数学模型并对多个控制回路解耦。进而,为提高 RL 的收敛速度和移动机器人的稳定性,基于 Lyapunov 理论和基于势的奖励塑形方法,提出一种基于 Lyapunov 奖励塑形的软 actor-critic (LSAC) 算法。从软策略迭代的策略评估和提升步骤证明了算法的收敛性和最优性。此外,针对循线机器人,改进了区域生长方法以适应岔路和环境干扰的影响。通过对比、测试和交叉验证,仿真和真实环境实验结果均表明所提 LSAC-PID 整定算法具有良好的性能。
引用
@article{arxiv.2111.02283,
title = {A Self-adaptive LSAC-PID Approach based on Lyapunov Reward Shaping for Mobile Robots},
author = {Xinyi Yu and Siyu Xu and Yuehai Fan and Linlin Ou},
journal= {arXiv preprint arXiv:2111.02283},
year = {2021}
}
备注
11 pages, 13 figures