中文

欠驱动双摆任务的平均奖励最大熵强化学习

机器人学 2024-09-16 v1 机器学习

摘要

本报告提出了一种针对体操机器人和摆动机器人的摆起与稳定任务的解决方案,该方案是为 IROS 2024 的 AI Olympics 竞赛开发的。我们的方法采用了平均奖励熵优势策略优化 (AR-EAPO),这是一种结合了平均奖励强化学习 (RL) 和最大熵强化学习的无模型强化学习算法。结果表明,与已建立的基线方法相比,我们的控制器在体操机器人和摆动机器人两种场景下均取得了更好的性能和鲁棒性得分,且无需精心设计的奖励函数或系统模型。当前结果仅适用于仿真阶段设置。

关键词

引用

@article{arxiv.2409.08938,
  title  = {Average-Reward Maximum Entropy Reinforcement Learning for Underactuated Double Pendulum Tasks},
  author = {Jean Seong Bjorn Choe and Bumkyu Choi and Jong-kook Kim},
  journal= {arXiv preprint arXiv:2409.08938},
  year   = {2024}
}