在无奖励条件下评估智能体
机器学习
2021-02-11 v2 人工智能
机器人学
摘要
强化学习已使智能体能够在未知环境中解决具有挑战性的任务。然而,人工设计奖励函数可能耗时、昂贵且易受人误影响而出错。已有竞争性目标被提出以使智能体在无外部监督下学习,但尚不清楚它们在多大程度上反映任务奖励或人类行为。为加速内在目标的发展,我们在预先收集的智能体行为数据集上回溯计算潜在目标,而非在线优化它们,并通过分析其相关性进行比较。我们在七个智能体、三款 Atari 游戏及 3D 游戏 Minecraft 上研究了输入熵、信息增益与赋能。我们发现,这三种内在目标均比任务奖励更强烈地与人类行为相似性度量相关。此外,输入熵与信息增益比任务奖励更强烈地与人类相似性相关,这表明可使用内在目标来设计行为类似于人类玩家的智能体。
引用
@article{arxiv.2012.11538,
title = {Evaluating Agents without Rewards},
author = {Brendon Matusch and Jimmy Ba and Danijar Hafner},
journal= {arXiv preprint arXiv:2012.11538},
year = {2021}
}
备注
15 pages, 6 figures, 5 tables