中文

Premier-TACO 是一个小样本策略学习器:通过时序动作驱动的对比损失预训练多任务表示

机器学习 2024-05-27 v4 人工智能 机器人学

摘要

我们提出了 Premier-TACO,这是一种多任务特征表示学习方法,旨在提高序列决策任务中小样本策略学习的效率。Premier-TACO 利用多任务离线数据集的一个子集来预训练通用特征表示,该表示能够捕捉关键的环境动态,并使用最少的专家演示进行微调。它通过引入一种新的负样本采样策略,推进了时序动作对比学习 (TACO) 目标(因在视觉控制任务中取得 SOTA 结果而闻名)。该策略对于显著提升 TACO 的计算效率至关重要,使得大规模多任务离线预训练成为可能。我们在包括 Deepmind Control Suite、MetaWorld 和 LIBERO 在内的一组多样化的连续控制基准中进行了广泛的实证评估,证明了 Premier-TACO 在预训练视觉表示方面的有效性,显著增强了对新任务的小样本模仿学习。我们的代码、预训练数据以及预训练模型检查点将在 https://github.com/PremierTACO/premier-taco 上发布。我们的项目网页位于 https://premiertaco.github.io。

关键词

引用

@article{arxiv.2402.06187,
  title  = {Premier-TACO is a Few-Shot Policy Learner: Pretraining Multitask Representation via Temporal Action-Driven Contrastive Loss},
  author = {Ruijie Zheng and Yongyuan Liang and Xiyao Wang and Shuang Ma and Hal Daumé and Huazhe Xu and John Langford and Praveen Palanisamy and Kalyan Shankar Basu and Furong Huang},
  journal= {arXiv preprint arXiv:2402.06187},
  year   = {2024}
}

备注

Accepted at Forty-first International Conference on Machine Learning (ICML 2024)