中文

通过功能奖励编码实现无监督零样本强化学习

机器学习 2024-02-28 v1 人工智能

摘要

我们能否从大量未标记的离线轨迹中预训练一个通用智能体,使其能够以零样本方式立即适应任何新的下游任务?在本文中,我们提出了一种功能奖励编码 (FRE),作为解决这一零样本强化学习 (RL) 问题的通用且可扩展的方案。我们的主要思想是通过使用基于 Transformer 的变分自编码器编码任意任务的状态 - 奖励样本来学习这些任务的功能表示。这种功能编码不仅使得智能体能够从多样化的通用无监督奖励函数中进行预训练,而且还提供了一种方法,即在给定少量奖励标注样本的情况下,以零样本方式解决任何新的下游任务。实证表明,在多样化随机无监督奖励函数上训练的 FRE 智能体可以泛化以解决一系列模拟机器人基准测试中的新任务,其表现往往优于之前的零样本 RL 和离线 RL 方法。该项目的代码提供于:https://github.com/kvfrans/fre

关键词

引用

@article{arxiv.2402.17135,
  title  = {Unsupervised Zero-Shot Reinforcement Learning via Functional Reward Encodings},
  author = {Kevin Frans and Seohong Park and Pieter Abbeel and Sergey Levine},
  journal= {arXiv preprint arXiv:2402.17135},
  year   = {2024}
}