半监督单样本模仿学习
机器学习
2024-08-13 v1 人工智能
摘要
单样本模仿学习(One-shot Imitation Learning, OSIL)旨在让 AI 智能体能够从单个演示中学习新任务。为此进行监督学习,OSIL 通常需要大量对应的专家演示——即对应于不同变体的同一语义任务的轨迹。为克服这一限制,我们引入了半监督 OSIL 的问题设定,其中学习智能体被呈现一个无任务标签的大量轨迹数据集(即未配对数据集),以及每个语义任务的少量多个演示的数据集(即配对数据集)。这构成了更真实和实用的few-shot学习embodiment,要求智能体有效地利用来自大量轨迹数据的弱监督。随后,我们开发了一种专为该半监督 OSIL 设置设计的算法。我们的 метод首先学习一个嵌入空间,其中不同任务唯一地聚类。我们利用该嵌入空间及其支持的聚类来自生成未配对数据集中轨迹之间的配对。通过仿真控制任务的实证结果,我们展示了在此类自生成配对上训练的 OSIL 模型与使用真实标签训练的 OSIL 模型保持竞争力,标志着 OSIL 标签效率的重大进步。
引用
@article{arxiv.2408.05285,
title = {Semi-Supervised One-Shot Imitation Learning},
author = {Philipp Wu and Kourosh Hakhamaneshi and Yuqing Du and Igor Mordatch and Aravind Rajeswaran and Pieter Abbeel},
journal= {arXiv preprint arXiv:2408.05285},
year = {2024}
}