Prompt-Tuning Bandits: 高效多任务离线强化学习的少样本泛化
机器学习
2025-07-21 v3
摘要
提示方法已成为调整大规模预训练Transformer模型以适应下游任务的主导范式。提示决策转换器(PDT)通过利用随机轨迹提示识别目标任务,实现了大规模、多任务离线强化学习(RL)的预训练。然而,这些提示来自专家演示的均匀抽样,忽略了一个关键限制:并非所有提示在区分任务方面都同样信息丰富。这限制了在低数据或开放世界环境中的泛化和适应,尤其是当样本效率至关重要时。为此,我们提出一种轻量级、推理时的基于bandit的提示调优框架。该bandit探索并优化轨迹提示选择以增强任务性能,同时避免对Transformer主干进行高成本的微调。我们的实验表明,除了由于bandit-based提示调优带来的明显性能提升外,还实现了更好的样本复杂度、可扩展性和提示空间探索,优于提示调优基线。这些结果凸显了自适应提示选择机制对离线多任务RL中高效泛化的重要性。
引用
@article{arxiv.2502.06358,
title = {Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL},
author = {Finn Rietz and Oleg Smirnov and Sara Karimi and Lele Cao},
journal= {arXiv preprint arXiv:2502.06358},
year = {2025}
}