通过协调多种学习策略应对模拟人机交互中人类奖励的变异性
机器人学
2020-05-11 v1
摘要
当前人机交互(Human-Robot Interaction, HRI)的一个重要挑战是使机器人能够即时从人类反馈中学习。然而,人类在奖励机器人的方式上表现出极大的变异性。我们提出通过使机器人结合不同的学习策略,即基于模型的(model-based, MB)和无模型的(model-free, MF)强化学习,来解决这个问题。我们模拟了两个 HRI 场景:一个简单任务,人类因机器人将正确的方块放入正确的盒子而给予赞赏;以及该任务的一个更复杂版本,其中方块必须以特定顺序放置。我们表明,先前在机器人导航中测试过的现有 MB-MF 协调算法在此处无需重新调整参数即可良好运行。它在产生与单独使用 MF 相同的最小计算成本的同时,实现了最高性能。此外,无论模拟的人类反馈如何变化,该算法都能给出稳健的性能,而每种单独的策略都会受到这种变异性的影响。总体而言,结果提出了一种在面临可变人类反馈时提升机器人学习灵活性的有前景的方法。
引用
@article{arxiv.2005.03987,
title = {Coping with the variability in humans reward during simulated human-robot interactions through the coordination of multiple learning strategies},
author = {Rémi Dromnelle and Benoît Girard and Erwan Renaudo and Raja Chatila and Mehdi Khamassi},
journal= {arXiv preprint arXiv:2005.03987},
year = {2020}
}
备注
6 pages, 5 figures, written for the RO-MAN 2020 conference. arXiv admin note: text overlap with arXiv:2004.14698