预训练语言模型提升决策Transformer的少样本提示能力
机器学习
2025-12-03 v2 人工智能
计算与语言
摘要
决策Transformer(DT)已成为强化学习(RL)任务中一类有前途的算法,它利用预先收集的数据集和Transformer对长序列建模的能力。最近的研究表明,在DT中使用任务轨迹片段作为提示可以增强其在未见任务上的性能,从而产生了Prompt-DT方法。然而,在许多场景中,从特定环境收集数据既昂贵又不安全,由于基于Transformer模型对数据的渴求,这会导致性能次优和少样本提示能力有限。此外,预训练中使用的有限数据集使得Prompt-DT类方法难以仅通过提示区分不同的RL任务。为了解决这些挑战,我们引入了语言模型初始化的提示决策Transformer(LPDT)框架,该框架利用预训练语言模型提供的先验知识,并通过低秩自适应(LoRA)对序列模型进行元RL任务的微调。我们还引入了提示正则化,以有效区分不同任务。全面的实证研究表明,使用预训练语言模型进行初始化提供了先验知识,并在某些MuJoCo控制任务中仅使用10%的数据就达到了与Prompt-DT相当的性能。我们还提供了详尽的消融研究,以验证每个组件(包括序列建模、语言模型、提示正则化和提示策略)的有效性。
关键词
引用
@article{arxiv.2408.01402,
title = {Pre-trained Language Models Improve the Few-shot Prompt Ability of Decision Transformer},
author = {Yu Yang and Pan Xu},
journal= {arXiv preprint arXiv:2408.01402},
year = {2025}
}
备注
2 figures, 10 tables. Published in Transactions on Machine Learning Research (TMLR)