一种具形式目标到达保证的新型智能体:移动机器人实验研究
机器人学
2024-09-24 v1 人工智能
动力系统
最优化与控制
摘要
强化学习 (RL) 被证明在机器人任务中有效且便捷,但需要探索足够大的数量的状态-动作对,其中许多可能是不安全的或无关紧要的。例如,在没有确保在剧集中到达某一特定状态集的保证情况下,线上无模型学习可能是危险且低效的。增加安全屏蔽系统以限制 RL 动作至安全动作集已成为常见做法。相对于这些框架,一个难题在于如何有效地将 RL 与屏蔽系统耦合,以确保探索不被过度限制。本工作提出一种新型安全无模型 RL 智能体,称为 Critic As Lyapunov Function (CALF),并展示了 CALF 如何在保持目标到达稳定性保证的前提下,以高效便捷的方式改进机器人控制基准。后者是安全的关键部分,故此在一般情况下都重要。CALF 确保所有状态-动作对均可被探索,同时保证目标状态的到达。提供了证明 CALF 具备目标稳定性保证特性的形式分析,并通过针对非全约束轮式移动机器人 (WMR) TurtleBot3 Burger 的一组真实世界和数值实验,确认了 CALF 在少数剧集设置下相对于诸如近端策略优化 (PPO) 和修改版 SARSA 等成熟 RL 智能体的优势,尤其在达到的总体成本方面。
引用
@article{arxiv.2409.14867,
title = {A novel agent with formal goal-reaching guarantees: an experimental study with a mobile robot},
author = {Grigory Yaremenko and Dmitrii Dobriborsci and Roman Zashchitin and Ruben Contreras Maestre and Ngoc Quoc Huy Hoang and Pavel Osinenko},
journal= {arXiv preprint arXiv:2409.14867},
year = {2024}
}