逆动力学预训练为多任务模仿学习提供良好表征
机器学习
2023-10-26 v2
摘要
近年来,自然语言处理和图像识别等领域普及了利用大规模数据集预训练表征并有效迁移至下游任务的范式。在本文中,我们评估在模仿学习中应如何实施该范式,其中预训练与微调数据均由专家与未知环境交互所收集的轨迹。具体而言,我们考虑一种设定:预训练语料由多任务演示组成,且每次演示的任务由一个未观测的潜上下文变量设定。目标是利用预训练语料学习高维(如视觉)观测空间的低维表征,并可迁移至新上下文以在有限演示数据集上微调。在多种可能的预训练目标中,我们认为逆动力学建模——即给定演示中某动作前后的观测来预测该动作——非常适合此设定。我们通过多种模拟视觉运动操控问题的评估提供了该主张的经验证据。尽管先前工作尝试了关于逆动力学建模益处的各种理论解释,我们发现这些论证不足以解释我们设定中常观察到的经验优势,因此我们基于一个简单但通用的环境模型推导了新的分析。
引用
@article{arxiv.2305.16985,
title = {Inverse Dynamics Pretraining Learns Good Representations for Multitask Imitation},
author = {David Brandfonbrener and Ofir Nachum and Joan Bruna},
journal= {arXiv preprint arXiv:2305.16985},
year = {2023}
}