中文

奖励训练轮: 机器人强化学习的自适应辅助奖励

机器人学 2025-03-21 v1 人工智能

摘要

机器人强化学习(RL)通常依赖于精心设计的辅助奖励来补充稀疏的 primary 学习目标,以弥补缺乏大规模真实世界试错数据的不足。尽管这些辅助奖励加快了学习速度,但需要 significant 工程 effort,可能引入人类偏见,且不能适应机器人在训练期间不断变化的能力。在本文中,我们引入奖励训练轮(RTW),一个教师-学生框架,用于自动化辅助奖励适应。具体而言,RTW教师根据学生不断变化的能力动态调整辅助奖励权重,以确定哪些辅助奖励方面需要更多或更少的强调以提高 primary 目标。我们在 RTW 上演示了两个具有挑战性的机器人任务:受限空间内的导航以及垂直条件困难 terrain 上越野车的机动性。在仿真中,RTW 在导航成功率上超过专家设计的奖励 2.35%,并通过 122.62% 提高越野车的机动性能,同时分别实现 35% 和 3 倍的 faster 训练效率。物理机器人实验进一步验证了 RTW 的有效性, 实现了完美的成功率(5/5 次试验 vs. 2/5 次专家设计的奖励),并通过最高 47.4% 的 reduction in orientation angles 来提高车辆稳定性。

关键词

引用

@article{arxiv.2503.15724,
  title  = {Reward Training Wheels: Adaptive Auxiliary Rewards for Robotics Reinforcement Learning},
  author = {Linji Wang and Tong Xu and Yuanjie Lu and Xuesu Xiao},
  journal= {arXiv preprint arXiv:2503.15724},
  year   = {2025}
}

备注

7 pages, 5 figures