基于逆强化学习的样本高效社会导航
机器人学
2021-06-22 v1 人工智能
机器学习
摘要
本文提出一种从人类轨迹观测中高效学习符合社会规范导航策略的算法。随着移动机器人进入并在社会空间中通行,它们必须考虑社会线索并以符合社会规范的方式行动。我们专注于从示例中学习此类线索。我们描述了一种基于逆强化学习的算法,该算法从人类轨迹观测中学习,而无需知道其具体动作。我们通过利用回放缓冲(见于许多离策略强化学习方法)的概念,消除了与逆强化学习相关的额外样本复杂度,从而相较替代方法提升了我们方法的样本效率。我们使用公开的行人运动数据集训练智能体来评估我们的方法,并与相关方法比较。我们表明,我们的方法在取得更好性能的同时,还减少了训练时间与样本复杂度。
引用
@article{arxiv.2106.10318,
title = {Sample Efficient Social Navigation Using Inverse Reinforcement Learning},
author = {Bobak H. Baghi and Gregory Dudek},
journal= {arXiv preprint arXiv:2106.10318},
year = {2021}
}