一种面向最优时间稳定性的策略优化方法
机器人学
2023-10-16 v2 机器学习
摘要
在当前无模型强化学习(RL)算法中,基于采样方法的稳定性准则常被用于指导策略优化。然而,这些准则仅保证系统状态无限时间收敛至平衡点,导致策略的次优性。本文提出一种结合基于采样的李雅普诺夫稳定性的策略优化技术。我们的方法使系统状态在最优时间内到达平衡点并此后保持稳定性,称为“最优时间稳定性”。为此,我们将该优化方法集成到Actor-Critic框架中,从而开发出自适应基于李雅普诺夫的Actor-Critic(ALAC)算法。通过在十个机器人任务上的评估,我们的方法显著优于先前研究,有效引导系统生成稳定模式。
引用
@article{arxiv.2301.00521,
title = {A Policy Optimization Method Towards Optimal-time Stability},
author = {Shengjie Wang and Fengbo Lan and Xiang Zheng and Yuxue Cao and Oluwatosin Oseni and Haotian Xu and Tao Zhang and Yang Gao},
journal= {arXiv preprint arXiv:2301.00521},
year = {2023}
}
备注
27 pages, 11 figues. 7th Annual Conference on Robot Learning. 2023