中文

价值求和:一种用于基于MPC的模型基强化学习的新型评分函数

机器学习 2023-07-20 v2 机器人学

摘要

本文针对基于MPC的强化学习方法规划模块中使用奖励函数对轨迹评分所固有的偏差,提出了一种新型评分函数。所提方法利用价值的折扣和增强了现有基于MPC的MBRL方法的学习效率。该方法利用最优轨迹引导策略学习,并基于真实世界和增强的机载数据更新其状态-动作价值函数。我们在选定的MuJoCo Gym环境以及为Cassie机器人仿真模型学习运动技能中评估了所提方法的学习效率。结果表明,所提方法在学习效率和平均奖励回报方面优于当前最先进的算法。

关键词

引用

@article{arxiv.2209.08169,
  title  = {Value Summation: A Novel Scoring Function for MPC-based Model-based Reinforcement Learning},
  author = {Mehran Raisi and Amirhossein Noohian and Luc Mccutcheon and Saber Fallah},
  journal= {arXiv preprint arXiv:2209.08169},
  year   = {2023}
}