中文

MURAL:面向结果驱动强化学习的元学习不确定性感知奖励

机器学习 2021-07-20 v2 机器人学

摘要

强化学习中的探索是一个具有挑战性的问题:在最坏情况下,智能体必须搜索可能隐藏在状态空间中任何位置的高奖励状态。我们能否定义一类更易于处理的强化学习问题,其中为智能体提供成功结果的示例?在此问题设定下,可通过训练一个将状态分类为成功与否的分类器来自动获得奖励函数。若训练得当,此类分类器可提供形状良好的目标地形,既促进向优良状态的进展,又提供校准的探索奖励。本工作中,我们展示了不确定性感知分类器能够通过鼓励探索并提供朝向正向结果的有向引导来解决困难的强化学习问题。我们提出了一种基于计算归一化最大似然(NML)分布的摊销技术来获取这些校准的、不确定性感知分类器的新型机制。为使该机制可行,我们提出了一种利用元学习计算 NML 分布的新方法。我们展示了所得算法与基于计数的探索方法和先前学习奖励函数的算法存在若干引人入胜的联系,同时提供更有效的目标导向引导。我们证明了我们的算法解决了若干具有挑战性的导航与机器人操作任务,这些任务对先前方法而言困难或不可能完成。

关键词

引用

@article{arxiv.2107.07184,
  title  = {MURAL: Meta-Learning Uncertainty-Aware Rewards for Outcome-Driven Reinforcement Learning},
  author = {Kevin Li and Abhishek Gupta and Ashwin Reddy and Vitchyr Pong and Aurick Zhou and Justin Yu and Sergey Levine},
  journal= {arXiv preprint arXiv:2107.07184},
  year   = {2021}
}

备注

Accepted to ICML 2021. First two authors contributed equally