调度式内在驱动:一种关于内在动机探索的分层视角
机器学习
2019-06-24 v2 人工智能
机器人学
机器学习
摘要
稀疏奖励强化学习中的探索仍是一个开放性挑战。许多最先进的方法使用内在动机来补充稀疏的外在奖励信号,使智能体在探索过程中有更多机会获得反馈。通常这些信号作为额外奖励加入,导致产生一种混合策略,既无法果断地进行探索,也无法果断地完成任务。在本文中,我们改为学习独立的内在和外在任务策略,并在这些不同驱动之间进行调度,以加速探索并稳定学习。此外,我们引入了一种新的内在奖励类型,称为后继特征控制(successor feature control, SFC),它是通用的且不与特定任务绑定。它考虑了完整轨迹上的统计信息,因此不同于以往仅使用局部信息来评估内在动机的方法。我们使用三种具有纯视觉输入的环境:VizDoom、DeepMind Lab 和 DeepMind Control Suite,来评估我们提出的调度式内在驱动(SID)智能体。结果表明,借助 SFC 以及对内在驱动的分层使用,探索效率得到了显著提升。我们的实验结果视频可在 https://youtu.be/b0MbY3lUlEI 查看。
引用
@article{arxiv.1903.07400,
title = {Scheduled Intrinsic Drive: A Hierarchical Take on Intrinsically Motivated Exploration},
author = {Jingwei Zhang and Niklas Wetzel and Nicolai Dorka and Joschka Boedecker and Wolfram Burgard},
journal= {arXiv preprint arXiv:1903.07400},
year = {2019}
}
备注
A video of our experimental results can be found at https://youtu.be/b0MbY3lUlEI