中文

基于李亚普诺夫奖励的机器人学习(SuPLE)

机器人学 2024-11-22 v1 人工智能

摘要

奖励函数是机器人学习中的关键组件。奖励直接影响学习的样本数和计算复杂度,以及解答的质量。信息丰富的奖励设计需要领域知识,而这并非总是可用。我们利用系统动力学的特性来产生符合系统需求的奖励,而无需添加外部假设。具体而言,我们探索一种利用系统动力学李亚普诺夫指数来生成系统内在奖励的方法。我们表明,正李亚普诺夫指数之和(Sum of the Positive Lyapunov Exponents, SuPLE)是设计此类奖励的强有力候选。我们发展了一个该奖励的计算框架,并在样本基准的稳定各种动力系统方面展示了其有效性。它消除了必须从任意状态开始训练轨迹的需求,即辅助探索。后者是模拟机器人学习中常见的做法,但在实际机器人系统中不可行,因为它们通常会从自然静止状态开始,例如摆锤在底部、机器人在地面上等,难以初始化于任意状态。将 SuPLE 与常用奖励函数进行比较,我们观察到后者即使在双摆摆起并保持其摆正位置稳定的任务中(这是多连杆机器人原型场景),在没有辅助探索的情况下也无法找到解决方案。SuPLE 引发的机器人学习奖励为在典型情境下有效的机器人学习提供了一条新途径,而非高度专业化或微调的情境。我们的代码已公开,以便可重复性和进一步研究。

关键词

引用

@article{arxiv.2411.13613,
  title  = {SuPLE: Robot Learning with Lyapunov Rewards},
  author = {Phu Nguyen and Daniel Polani and Stas Tiomkin},
  journal= {arXiv preprint arXiv:2411.13613},
  year   = {2024}
}

备注

7 pages, 4 figures