基于提示的决策Transformer用于少样本策略泛化
机器学习
2022-06-28 v1 人工智能
计算机视觉与模式识别
机器人学
摘要
人类可以利用先验经验并从少量演示中学习新任务。与旨在通过更好的算法设计实现快速适应的离线元强化学习不同,我们研究了架构归纳偏置对少样本学习能力的影响。我们提出了一种基于提示的决策Transformer(Prompt-DT),它利用Transformer架构的序列建模能力和提示框架,在离线强化学习中实现少样本适应。我们设计了轨迹提示,其包含少样本演示的片段,并编码任务特定信息以指导策略生成。我们在五个MuJoCo控制基准上的实验表明,Prompt-DT是一个强大的少样本学习器,无需在未见目标任务上做任何额外微调。Prompt-DT仅使用包含少数时间步的轨迹提示,就以大幅优势优于其变体和强大的元离线强化学习基线。Prompt-DT对提示长度变化也具有鲁棒性,并能泛化到分布外(OOD)环境。
引用
@article{arxiv.2206.13499,
title = {Prompting Decision Transformer for Few-Shot Policy Generalization},
author = {Mengdi Xu and Yikang Shen and Shun Zhang and Yuchen Lu and Ding Zhao and Joshua B. Tenenbaum and Chuang Gan},
journal= {arXiv preprint arXiv:2206.13499},
year = {2022}
}
备注
ICML 2022. Project page: https://mxu34.github.io/PromptDT/