中文

基于理论建模、探索与规划达到人类水平强化学习

人工智能 2021-07-28 v1

摘要

强化学习(RL)研究智能体如何随时间通过与环境的交互获得奖励。机器强化学习的最新进展已超越人类在世界上最古老的棋盘游戏和许多经典视频游戏上的专长,但它们需要大量经验才能成功学习——当今的算法都无法解释人类为何能如此快速学会如此多不同的任务。在此,我们针对这一挑战提出一种新方法,基于一种特别强大的基于模型的强化学习形式,我们称之为基于理论的强化学习(Theory-Based Reinforcement Learning),因为它使用类人的直觉理论——关于物理对象、意向主体及其相互作用的丰富、抽象、因果模型——来探索和建模环境,并有效规划以实现任务目标。我们在名为 EMPA(探索、建模与规划智能体,Exploring, Modeling, and Planning Agent)的视频游戏玩家智能体中实现了该方法,它执行贝叶斯推断以学习表示为游戏引擎模拟器程序的概率生成模型,并在这些模型上运行内部模拟以支持高效的基于对象、关系式的探索和启发式规划。EMPA 在包含 90 个具有挑战性的 Atari 风格视频游戏的测试套件上密切匹配人类学习效率,仅通过几分钟的游戏游玩即可学习新游戏,并稳健地泛化到新游戏情境和新关卡。该模型还捕捉了人类探索轨迹和学习动态中的细粒度结构。其设计与行为为构建更通用、类人的 AI 系统指明了一条前进道路。

关键词

引用

@article{arxiv.2107.12544,
  title  = {Human-Level Reinforcement Learning through Theory-Based Modeling, Exploration, and Planning},
  author = {Pedro A. Tsividis and Joao Loula and Jake Burga and Nathan Foss and Andres Campero and Thomas Pouncy and Samuel J. Gershman and Joshua B. Tenenbaum},
  journal= {arXiv preprint arXiv:2107.12544},
  year   = {2021}
}