PASTA: 预训练动作-状态 Transformer 智能体
人工智能
2023-12-05 v2 机器学习
摘要
自监督学习在包括自然语言处理、视觉和生物学在内的各个计算领域带来了革命性的范式转变。近期的方法涉及在大量无标签数据上预训练 transformer 模型,作为高效解决下游任务的起点。在强化学习中,研究者最近改编了这些方法,开发了在专家轨迹上预训练的模型。这一进展使模型能够处理从机器人技术到推荐系统的广泛任务。然而,现有方法大多依赖于为特定下游应用量身定制的复杂预训练目标。本文对称为预训练动作-状态 transformer 智能体(PASTA)的模型进行了全面研究。我们的研究涵盖了一种统一的方法,并覆盖了一系列广泛的通用下游任务,包括行为克隆、离线 RL、传感器故障鲁棒性和动力学变化适应。我们的目标是对各种设计选择进行系统比较,并提供有助于从业者开发鲁棒模型的宝贵见解。我们研究的关键亮点包括:对动作和状态进行组件级分词、使用诸如下一 token 预测或掩码语言建模等基本预训练目标、跨多个领域同时训练模型,以及应用各种微调策略。在本研究中,开发的模型参数量少于 700 万,使广大社区能够使用这些模型并复现我们的实验。我们希望本研究能鼓励进一步探索使用具有第一性原理设计选择的 transformer 来表示 RL 轨迹,并为鲁棒策略学习做出贡献。
引用
@article{arxiv.2307.10936,
title = {PASTA: Pretrained Action-State Transformer Agents},
author = {Raphael Boige and Yannis Flet-Berliac and Arthur Flajolet and Guillaume Richard and Thomas Pierrot},
journal= {arXiv preprint arXiv:2307.10936},
year = {2023}
}