基于偶然性感知观测中时空奖励分解的零样本策略学习
机器学习
2021-03-16 v2 人工智能
机器学习
摘要
使智能体在一个环境中学习并泛化到未见环境而无需进一步数据收集和微调,是一个长期存在的挑战。本文考虑一种符合生物智能体学习与泛化过程的零样本泛化问题设定。智能体首先被呈现训练环境中的既往经验,以及以轨迹级稀疏奖励形式给出的任务描述。随后当其被置于新测试环境中时,要求在不与测试环境进行任何交互的情况下完成任务。我们发现该设定对生物而言自然,同时对以往方法具有挑战性。行为克隆、最先进的强化学习及其他零样本学习方法在该基准上表现不佳。给定训练环境中的一组经验,我们的方法学习一个神经函数,将稀疏奖励分解为偶然性感知观测中的特定区域作为逐步奖励。基于此类分解奖励,我们进一步学习动力学模型并使用模型预测控制(MPC)获得策略。由于奖励被分解到更细粒度观测,它们自然可泛化到由相似基本元素构成的新环境。我们在广泛环境中展示了方法,包括经典视频游戏——超级马里奥兄弟,以及机器人连续控制任务。更多可视化结果请参考项目页面。
引用
@article{arxiv.1910.08143,
title = {Zero-shot Policy Learning with Spatial Temporal RewardDecomposition on Contingency-aware Observation},
author = {Huazhe Xu and Boyuan Chen and Yang Gao and Trevor Darrell},
journal= {arXiv preprint arXiv:1910.08143},
year = {2021}
}