基于障碍函数的奖励塑形用于强化学习
机器人学
2024-09-17 v2
摘要
强化学习(RL)已从简单的控制任务发展到具有大状态空间的复杂现实挑战。虽然RL在这些任务中表现出色,但训练时间仍然是一个限制。奖励塑形是一种流行的解决方案,但现有方法通常依赖于价值函数,这面临可扩展性问题。本文提出了一种新颖的基于障碍函数的安全导向奖励塑形框架,具有简单性和易于在各种环境和任务中实现的优点。为了评估所提出的奖励公式的有效性,我们在CartPole、Ant和Humanoid环境中进行了仿真实验,并在Unitree Go1四足机器人上进行了实际部署。我们的结果表明,与原始奖励相比,我们的方法导致收敛速度提高1.4-2.8倍,驱动力矩低至50-60%。在Go1机器人的仿真到现实实验中,我们展示了使用我们的奖励框架对机器人更好的控制和动力学。
引用
@article{arxiv.2403.01410,
title = {Barrier Functions Inspired Reward Shaping for Reinforcement Learning},
author = {Nilaksh Nilaksh and Abhishek Ranjan and Shreenabh Agrawal and Aayush Jain and Pushpak Jagtap and Shishir Kolathaya},
journal= {arXiv preprint arXiv:2403.01410},
year = {2024}
}
备注
7 pages, 10 figures, Accepted as contributed paper at ICRA 2024