稳定逆强化学习:基于控制李雅普诺夫景观的策略
系统与控制
2024-05-15 v1 机器学习
系统与控制
摘要
从专家演示中学习,以灵活地为自主系统编程复杂行为或预测智能体的行为,是一种强大的工具,尤其是在协同控制场景中。解决该问题的一种常见方法是逆强化学习(IRL),其中假设被观察的智能体(例如人类演示者)是根据反映其意图并指导其控制动作的内在成本函数的优化来行动的。虽然该框架具有很强的表达能力,但其计算要求高且通常缺乏收敛性保证。因此,我们提出了一种新颖的、具有稳定性保证的 IRL 方法,通过将成本函数推断问题重新表述为从演示数据中学习控制李雅普诺夫函数(CLF)。通过进一步利用相关控制策略的闭式表达式,我们能够通过观察诱导动力学的吸引子景观来高效搜索 CLF 空间。为了构造逆最优 CLF,我们使用了平方和并构建了一个凸优化问题。我们对 CLF 提供的最优性性质进行了理论分析,并使用模拟和真实世界数据评估了我们的方法。
引用
@article{arxiv.2405.08756,
title = {Stable Inverse Reinforcement Learning: Policies from Control Lyapunov Landscapes},
author = {Samuel Tesfazgi and Leonhard Sprandl and Armin Lederer and Sandra Hirche},
journal= {arXiv preprint arXiv:2405.08756},
year = {2024}
}