中文

Mega-Reward:在无外在奖励下实现人类水平游戏表现

人工智能 2019-11-28 v4

摘要

内在奖励被引入以模拟人类智能的运作方式;它们通常通过内在动机驱动的游戏进行评估,即在无外在奖励的情况下玩游戏但以外在奖励评估。然而,在内在动机驱动游戏这一极具挑战性的设定下,现有内在奖励方法均无法达到人类水平表现。本工作中,我们提出一种新颖的受夸大妄想驱动的内在奖励(称为mega-reward),据我们所知,这是首个在内在动机驱动游戏中达到人类水平表现的方法。直观上,mega-reward源于如下观察:当婴儿试图对环境中的实体获得更多控制时其智能得以发展;因此,mega-reward旨在最大化智能体在给定环境中对给定实体的控制能力。为形式化mega-reward,我们提出一种关系转移模型以弥合直接控制与潜在控制之间的鸿沟。实验研究表明,mega-reward(i)能大幅优于所有最先进的内在奖励方法,(ii)总体上达到与Ex-PPO及职业人类水平分数相同的表现水平,且(iii)在与外在奖励结合时亦具有优越性能。

关键词

引用

@article{arxiv.1905.04640,
  title  = {Mega-Reward: Achieving Human-Level Play without Extrinsic Rewards},
  author = {Yuhang Song and Jianyi Wang and Thomas Lukasiewicz and Zhenghua Xu and Shangtong Zhang and Andrzej Wojcicki and Mai Xu},
  journal= {arXiv preprint arXiv:1905.04640},
  year   = {2019}
}