价值求和:一种用于基于MPC的模型基强化学习的新型评分函数
机器学习
2023-07-20 v2 机器人学
摘要
本文针对基于MPC的强化学习方法规划模块中使用奖励函数对轨迹评分所固有的偏差,提出了一种新型评分函数。所提方法利用价值的折扣和增强了现有基于MPC的MBRL方法的学习效率。该方法利用最优轨迹引导策略学习,并基于真实世界和增强的机载数据更新其状态-动作价值函数。我们在选定的MuJoCo Gym环境以及为Cassie机器人仿真模型学习运动技能中评估了所提方法的学习效率。结果表明,所提方法在学习效率和平均奖励回报方面优于当前最先进的算法。
引用
@article{arxiv.2209.08169,
title = {Value Summation: A Novel Scoring Function for MPC-based Model-based Reinforcement Learning},
author = {Mehran Raisi and Amirhossein Noohian and Luc Mccutcheon and Saber Fallah},
journal= {arXiv preprint arXiv:2209.08169},
year = {2023}
}