中文

双摆任务全局策略的平均奖励最大熵强化学习

机器人学 2025-05-13 v1

摘要

本报告提出了基于强化学习的方法,用于acrobot和pendubot的摆起与稳定任务,紧扣第3届AI奥运会(ICRA 2025)的最新指南。我们在先前开发的平均奖励熵优势策略优化(AR-EAPO)算法基础上,不断完善解决方案,以有效应对新的竞赛情景与评估指标。大量仿真实验验证了该控制器在更新后的框架下能稳健地管理这些任务,展现出适应性与有效性。

关键词

引用

@article{arxiv.2505.07516,
  title  = {Average-Reward Maximum Entropy Reinforcement Learning for Global Policy in Double Pendulum Tasks},
  author = {Jean Seong Bjorn Choe and Bumkyu Choi and Jong-kook Kim},
  journal= {arXiv preprint arXiv:2505.07516},
  year   = {2025}
}