CACTO:结合轨迹优化的连续 Actor-Critic —— 迈向全局最优
机器人学
2023-05-09 v3 机器学习
最优化与控制
摘要
本文提出一种用于动力系统连续控制的新型算法,该算法将轨迹优化(TO)与强化学习(RL)结合于单一框架中。该算法的动机源于 TO 与 RL 在应用于连续非线性系统以最小化非凸代价函数时的两大主要局限。具体而言,当搜索初始化未接近“良好”极小值时,TO 会陷入较差的局部极小。另一方面,在处理连续状态与控制空间时,RL 训练过程可能过长且强烈依赖于探索策略。因此,我们的算法通过 TO 引导的 RL 策略搜索学习“良好”控制策略,该策略用作 TO 的初始猜测提供器时,使轨迹优化过程更不易收敛到较差的局部最优。我们的方法在若干包含非凸避障的到达问题上得到验证,涉及不同动力系统,包括 6 维状态汽车模型与 3 关节平面机械臂。结果表明,CACTO 在逃离局部极小方面具有出色能力,同时比深度确定性策略梯度(DDPG)与近端策略优化(PPO)等 RL 算法计算更高效。
引用
@article{arxiv.2211.06625,
title = {CACTO: Continuous Actor-Critic with Trajectory Optimization -- Towards global optimality},
author = {Gianluigi Grandesso and Elisa Alboni and Gastone P. Rosati Papini and Patrick M. Wensing and Andrea Del Prete},
journal= {arXiv preprint arXiv:2211.06625},
year = {2023}
}
备注
8 pages, 8 figures. Submitted to IEEE RA-L