中文

基于内在奖励匹配的技巧型强化学习

机器学习 2023-05-29 v4 人工智能 机器人学

摘要

尽管无监督技巧发现已在自主获取行为基元方面展现出前景,但在任务无关的技巧预训练与下游任务感知的微调之间仍存在较大的方法学脱节。我们提出内在奖励匹配(Intrinsic Reward Matching, IRM),其通过技巧判别器——一个常在微调时被丢弃的预训练模型组件——统一了这两个学习阶段。常规方法直接在策略层面对预训练智能体进行微调,常依赖昂贵的环境 rollout 来经验性地确定最优技巧。然而,通常对任务最简洁而完整的描述是奖励函数本身,且技巧学习方法通过判别器学习到对应于技巧策略的内在奖励函数。我们提议利用技巧判别器来匹配内在奖励与下游任务奖励,并在无环境样本的情况下确定未知任务的最优技巧,从而以更高的样本效率进行微调。此外,我们将 IRM 推广至为复杂、长视野任务组合技巧,并证明在 Fetch 桌面操作和 Franka Kitchen 机器人操作基准上,IRM 使我们比以往的技巧选择方法更有效地利用预训练技巧。

关键词

引用

@article{arxiv.2210.07426,
  title  = {Skill-Based Reinforcement Learning with Intrinsic Reward Matching},
  author = {Ademi Adeniji and Amber Xie and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2210.07426},
  year   = {2023}
}

备注

16 pages