分解控制李雅普诺夫函数以实现高效强化学习
系统与控制
2024-03-20 v1 机器学习
系统与控制
摘要
近期使用强化学习(RL)的方法已被证明能在未知环境中成功训练智能体。然而,RL 尚未广泛应用于现实世界的机器人场景。这是因为当前最先进的 RL 方法需要大量数据来学习特定任务,导致在现实应用中部署智能体收集数据时成本过高。本文基于现有工作,通过引入控制李雅普诺夫函数(Control Lyapunov Function, CLF)重塑 RL 中的奖励函数,该方法已被证明能降低样本复杂度。尽管如此,这种形式化方法需要已知系统的 CLF,但由于缺乏通用方法,确定合适的 CLF 往往是一个挑战。现有工作可通过 Hamilton-Jacobi 可达性过程计算低维 CLF。然而,这类方法在高维系统上变得难以处理,我们通过使用系统分解技术计算我们称之为分解控制李雅普诺夫函数(Decomposed Control Lyapunov Functions, DCLFs)来解决这一问题。我们使用计算得到的 DCLF 进行奖励塑形,并证明这能提高 RL 性能。通过多个示例,我们展示了该方法的有效性,其中我们的方法找到的策略成功实现了四旋翼飞行器的着陆,所需真实世界数据量不到最先进的 Soft-Actor Critic 算法所需的一半。
引用
@article{arxiv.2403.12210,
title = {Decomposing Control Lyapunov Functions for Efficient Reinforcement Learning},
author = {Antonio Lopez and David Fridovich-Keil},
journal= {arXiv preprint arXiv:2403.12210},
year = {2024}
}