中文

利用人类注视高效引导模仿学习智能体

机器学习 2021-04-23 v4 人工智能

摘要

众所周知,人类注视是任务演示中揭示意图的信号。在这项工作中,我们利用人类演示者的注视线索来增强通过三种流行模仿学习方法训练的智能体的性能——行为克隆(BC)、从观测行为克隆(BCO)和轨迹排序奖励外推(T-REX)。基于强化学习智能体的注意力与人类注视之间的相似性,我们提出了一种以计算高效方式利用注视数据的新方法,作为辅助损失函数的一部分,引导网络在人类注视 fixation 的图像区域具有更高的激活。本工作是朝着用辅助注视数据增强任何现有卷积模仿学习智能体训练的一步。我们的基于覆盖的辅助注视损失(CGL)引导学习朝向更好的奖励函数或策略,不添加任何额外的可学习参数,且不需要在测试时使用注视数据。我们发现,我们提出的方法在 20 款不同 Atari 游戏上平均将 BC 性能提升 95%、BCO 提升 343%、T-REX 提升 390%。我们还发现,与先前最先进的由人类注视辅助的模仿学习方法(AGIL)相比,我们的方法取得了更好的性能,并且在用更少演示进行学习时更高效。我们进一步用显著性图可视化方法解释训练好的 CGL 智能体以解释其性能。最后,我们表明 CGL 可以帮助缓解模仿学习中一个众所周知的因果混淆问题。

关键词

引用

@article{arxiv.2002.12500,
  title  = {Efficiently Guiding Imitation Learning Agents with Human Gaze},
  author = {Akanksha Saran and Ruohan Zhang and Elaine Schaertl Short and Scott Niekum},
  journal= {arXiv preprint arXiv:2002.12500},
  year   = {2021}
}

备注

AAMAS 2021