中文

预训练语言模型提升决策变换器的少样本提示能力

高能物理 - 理论 2025-09-30 v4

摘要

决策变换器(DT)作为离线强化学习(RL)任务中一类有前景的算法出现,利用预先收集的数据集和变换器建模长序列的能力。近期研究表明,使用训练任务中的部分轨迹作为 DT 的提示可以提升其在未见任务上的性能,由此产生了 Prompt-DT 方法。然而,在许多场景下从特定环境中收集数据既昂贵又不安全,导致由于基于变换器模型的数据饥渴特性而表现欠佳,且少样本提示能力有限。此外,预训练中使用的有限数据集使得 Prompt-DT 类型方法难以仅通过提示来区分不同的 RL 任务。为解决这些挑战,我们提出了语言模型初始化的提示决策变换器(LPDT)框架,该框架利用预训练语言模型为 RL 任务提供丰富的先验知识,并通过低秩适配(LoRA)对序列模型进行元 RL 问题的微调。我们进一步引入提示正则化,以基于提示特征表示有效地区分不同任务。全面的实证研究表明,使用预训练语言模型进行初始化可以提供先验知识,并在某些 MuJoCo 控制任务中仅使用 10% 的数据即可达到与 Prompt-DT 类似的性能。我们还提供了全面的消融研究以验证每个组件的有效性,包括序列建模、语言模型、提示正则化和提示策略。

关键词

引用

@article{arxiv.2408.01403,
  title  = {Type II orientifold flux vacua in 3D},
  author = {Álvaro Arboleya and Adolfo Guarino and Matteo Morittu},
  journal= {arXiv preprint arXiv:2408.01403},
  year   = {2025}
}

备注

59 pages, 30 tables. v2: new results added on type IIA mass spectra, discussion on scales and sources corrected, results and conclusions unaffected, references added. v3: minor corrections, published version. v4: discussion on scale separation improved, conclusions unaffected