中文

基于子目标奖励塑形的人机社交导航方法

机器人学 2021-04-15 v1 人工智能 机器学习

摘要

随着机器智能的发展,社交导航日益受到关注。由于强化学习能以较低计算成本在预测阶段选择动作,其已被应用于社交导航任务中。然而,强化学习在学习阶段需经历海量迭代才能获取行为策略,这对机器人在真实世界中的行为学习产生负面影响。特别地,社交导航环境中包含作为不可预测移动障碍物的人。我们提出了一种带子目标的奖励塑形方法以加速学习,其核心是一种利用子目标对强化学习算法进行塑形的聚合方法。我们开展了社交导航任务的学习实验,其中机器人规避碰撞并抵达目标。实验结果表明,该方法相较基础算法提升了任务中的学习效率。

关键词

引用

@article{arxiv.2104.06410,
  title  = {Reward Shaping with Subgoals for Social Navigation},
  author = {Takato Okudo and Seiji Yamada},
  journal= {arXiv preprint arXiv:2104.06410},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2104.06163