中文

面向移动机器人的基于保证 Lyapunov 类似稳定器的强化学习目标到达控制

机器人学 2026-01-28 v1

摘要

强化学习(RL)在学习目标到达策略方面效果显著,但通常无法提供保证目标必然到达的形式保证。为提供形式化的目标到达保证,常见做法是引入屏蔽机制以限制智能体仅执行满足预定义安全约束的动作。主要挑战在于将该机制与 RL 集成,使得学习和探索保持有效,又不至于过于保守。因此,本文提出一种 RL 基于控制框架,为在非结构化环境中运行的轮式移动机器人提供形式化的目标到达保证。我们首先设计了一个实时的 RL 策略,包含 15 个精心定义的奖励项。这些奖励鼓励机器人到达静态和动态目标,同时生成足够平滑的指令信号以符合预定义的安全规范,这在实际中至关重要。其次,将一种类似 Lyapunov 的稳定器层集成到基准 RL 框架中作为策略监督器,以形式化地强化目标到达控制,同时保持对状态动作空间的有意义探索。该方法适用于在具有挑战性环境中的实时部署,由于提供了对目标状态收敛的形式保证,并通过基于当前状态生成实时控制信号来补偿不确定性,同时尊重现实世界的运动约束。实验结果表明,所提出的类似 Lyapunov 的稳定器持续地改进了基准 RL 策略,将目标到达率从 84.6% 提升至 99.0%,显著减少故障,提高效率。

关键词

引用

@article{arxiv.2601.19499,
  title  = {Reinforcement Learning Goal-Reaching Control with Guaranteed Lyapunov-Like Stabilizer for Mobile Robots},
  author = {Mehdi Heydari Shahna and Seyed Adel Alizadeh Kolagar and Jouni Mattila},
  journal= {arXiv preprint arXiv:2601.19499},
  year   = {2026}
}