CLF-RL:控制李雅普诺夫函数引导的强化学习
机器人学
2026-01-01 v2
摘要
强化学习(Reinforcement Learning, RL)在为双足机器人生成鲁棒的运动策略方面展现出了潜力,但常常面临繁琐的奖励设计和对不良形状目标的敏感性。在这项工作中,我们提出了一个结构化的奖励塑形框架,该框架利用基于模型的轨迹生成和控制李雅普诺夫函数(Control Lyapunov Functions, CLF)来引导策略学习。我们探索了两种用于生成参考轨迹的基于模型的规划器:用于基于速度条件运动规划的降阶线性倒立摆(Linear Inverted Pendulum, LIP)模型,以及使用全阶动力学的基于混合零动力学(Hybrid Zero Dynamics, HZD)的预计算步态库。这些规划器定义了期望的末端执行器和关节轨迹,用于构建基于 CLF 的奖励,以惩罚跟踪误差并鼓励快速收敛。该公式提供了有意义的中间奖励,并且一旦参考可用就易于实现。参考轨迹和 CLF 塑形仅在训练期间使用,从而在部署时产生轻量级策略。我们在仿真中以及通过在 Unitree G1 机器人上的大量真实世界实验验证了我们的方法。与基线 RL 策略相比,CLF-RL 表现出显著提高的鲁棒性,并且比经典的跟踪奖励 RL 公式具有更好的性能。
引用
@article{arxiv.2508.09354,
title = {CLF-RL: Control Lyapunov Function Guided Reinforcement Learning},
author = {Kejun Li and Zachary Olkin and Yisong Yue and Aaron D. Ames},
journal= {arXiv preprint arXiv:2508.09354},
year = {2026}
}
备注
8 pages; 7 figures