作为李雅普诺夫函数的评论家(CALF):一种无模型、确保稳定性的智能体
机器人学
2024-09-17 v1 人工智能
最优化与控制
摘要
本工作提出并展示了一种新颖的强化学习智能体,称为作为李雅普诺夫函数的评论家(CALF),它是无模型的,并确保在线环境,即动力系统稳定。在线意味着在每个学习回合中,所述环境都是稳定的。正如在移动机器人模拟器的案例研究中所展示的,这极大地提高了整体学习性能。CALF 的基础演员-评论家方案类似于 SARSA。后者在我们的研究中未能成功到达目标。然而,其修改版本(此处称为 SARSA-m)在某些学习场景中确实成功了。尽管如此,CALF 仍然大大优于所述方法。CALF 还被证明可以改进提供给它的名义稳定器。总之,所提出的智能体可被视为将经典控制与强化学习融合的一种可行方法。其并行方法大多是在线的或基于模型的,例如那些将模型预测控制融合到智能体中的方法。
引用
@article{arxiv.2409.09869,
title = {Critic as Lyapunov function (CALF): a model-free, stability-ensuring agent},
author = {Pavel Osinenko and Grigory Yaremenko and Roman Zashchitin and Anton Bolychev and Sinan Ibrahim and Dmitrii Dobriborsci},
journal= {arXiv preprint arXiv:2409.09869},
year = {2024}
}
备注
IEEE Conference on Decision and Control. Accepted for publication in proceedings of the conference