中文

指明方向:来自演示数据的内在动机

机器学习 2021-01-14 v2 机器学习

摘要

决策领域中探索的研究历史悠久却仍存活跃争论。从数十年来不同视角(如发展心理学、实验设计、人工智能)探讨此主题的浩瀚文献中,内在动机作为一种可实际迁移至人工智能体的概念浮现。尤其在深度强化学习(RL)近期领域中,智能体以探索奖励(主要利用新颖性论证)的形式将该概念实现为加于任务奖励之上、鼓励遍历环境的探索红利。该思路得到大量RL理论支持——其最优性收敛假设穷尽式探索。然而,人类与哺乳动物并非穷尽探索世界,其动机不仅基于新颖性,亦基于其他多种因素(如好奇、趣味、风格、愉悦、安全、竞争等)。它们为终身学习目标优化,并在无明显目标的训练场中训练可迁移技能,还应用先天或习得先验以节省时间并保持安全。基于此,我们提出从演示数据中学习探索红利,以少量关于其原理的假设将这些动机迁移至人工智能体。利用逆RL方法,我们表明反映不同动机的复杂探索行为可被学习,并被RL智能体高效用于解决穷尽探索不可行的任务。

关键词

引用

@article{arxiv.2006.12917,
  title  = {Show me the Way: Intrinsic Motivation from Demonstrations},
  author = {Léonard Hussenot and Robert Dadashi and Matthieu Geist and Olivier Pietquin},
  journal= {arXiv preprint arXiv:2006.12917},
  year   = {2021}
}

备注

AAMAS 2021