中文

体操机器人阶段性奖励塑形:受限多目标强化学习方法

机器人学 2024-09-25 v1 人工智能

摘要

随着通过强化学习(RL)解决的任务复杂度的增加,奖励函数的定义也变得非常复杂。我们引入了一种旨在通过直观策略简化奖励塑形过程的RL方法。首先,与其使用由多个术语组成的单个奖励函数,我们定义了受限多目标RL(CMORL)框架中的多个奖励和成本函数。对于涉及顺序复杂运动的任务,我们将任务分为 distinct 阶段为每个阶段定义多个奖励和成本。最后,我们引入了一种实际的CMORL算法,该算法根据这些奖励最大化目标,同时满足由成本定义的约束。该方法已在仿真和真实环境中成功应用于各种体操任务。此外,已显示其成功地执行了与现有RL和受限RL算法相比的任务。我们的代码可在 https://github.com/rllab-snu/Stage-Wise-CMORL 查阅。

关键词

引用

@article{arxiv.2409.15755,
  title  = {Stage-Wise Reward Shaping for Acrobatic Robots: A Constrained Multi-Objective Reinforcement Learning Approach},
  author = {Dohyeong Kim and Hyeokjin Kwon and Junseok Kim and Gunmin Lee and Songhwai Oh},
  journal= {arXiv preprint arXiv:2409.15755},
  year   = {2024}
}

备注

7 pages