新颖环境中的快速任务求解
机器学习
2021-04-21 v3 人工智能
神经与进化计算
机器学习
摘要
我们提出新颖环境中的快速任务求解(RTS)挑战,其中智能体必须在陌生环境中尽可能快速地求解一系列任务。一个有效的 RTS 智能体必须在新环境中探索与求解当前任务之间取得平衡,同时构建新环境的模型,以便在面对后续任务时基于该模型进行规划。尽管现代深度强化学习(RL)智能体孤立地展现出其中部分能力,但均不适用于完整的 RTS 挑战。为推动 RTS 研究进展,我们引入两个挑战域:(1)称为记忆与规划游戏的最小 RTS 挑战;(2)一次性 StreetLearn 导航,其引入了来自真实世界数据的规模与复杂性。我们证明最先进的深度 RL 智能体在两个域中均无法应对 RTS,且该失败源于无法对所积累知识进行规划。我们开发了情景规划网络(EPNs),并展示配备 EPN 的深度 RL 智能体在 RTS 中表现出色,以 2-3 倍的差距优于最接近的基线,并能在单个情景内学会导航未见的 StreetLearn 地图。我们展示 EPN 学会执行类值迭代的规划算法,且其能泛化至训练经验之外的情形。
引用
@article{arxiv.2006.03662,
title = {Rapid Task-Solving in Novel Environments},
author = {Sam Ritter and Ryan Faulkner and Laurent Sartran and Adam Santoro and Matt Botvinick and David Raposo},
journal= {arXiv preprint arXiv:2006.03662},
year = {2021}
}