基于子目标奖励塑形的人机社交导航方法
机器人学
2021-04-15 v1 人工智能
机器学习
摘要
随着机器智能的发展,社交导航日益受到关注。由于强化学习能以较低计算成本在预测阶段选择动作,其已被应用于社交导航任务中。然而,强化学习在学习阶段需经历海量迭代才能获取行为策略,这对机器人在真实世界中的行为学习产生负面影响。特别地,社交导航环境中包含作为不可预测移动障碍物的人。我们提出了一种带子目标的奖励塑形方法以加速学习,其核心是一种利用子目标对强化学习算法进行塑形的聚合方法。我们开展了社交导航任务的学习实验,其中机器人规避碰撞并抵达目标。实验结果表明,该方法相较基础算法提升了任务中的学习效率。
引用
@article{arxiv.2104.06410,
title = {Reward Shaping with Subgoals for Social Navigation},
author = {Takato Okudo and Seiji Yamada},
journal= {arXiv preprint arXiv:2104.06410},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2104.06163