面向零样本策略学习的极简提示
机器学习
2024-05-13 v1
摘要
基于 Transformer 的方法在针对目标域演示或示例解决方案进行推理时表现出显著的泛化能力。尽管演示作为任务规定的方式可以捕获可能难以通过语言指定的丰富信息,但从演示中提取什么信息有助于泛化仍不明确。此外,在许多实际场景中,尤其是在机器人应用中,假设获取未见任务的演示是不切实际或不合理的。这促使我们探索最小化足以激发与演示相当泛化能力的提示。我们在上下文 RL 环境中研究此问题,该环境允许对泛化进行量化测量,通常采用 meta-RL 和多任务 RL 框架。在此环境中,训练和测试 Markov Decision Process (MDP) 仅在某些属性上存在差异,我们称之为任务参数。我们展示了仅以这些任务参数为条件的决策转换器可以在与演示条件下的零样本泛化能力相当或更好。这表明任务参数对于泛化至关重要,DT 模型正试图从演示提示中恢复这些参数。为了从监督中提取剩余的可泛化信息,我们引入了额外的可学习提示,经实验证明可进一步提升零样本泛化能力,涵盖广泛的机器人控制、操作和导航基准任务。
引用
@article{arxiv.2405.06063,
title = {A Minimalist Prompt for Zero-Shot Policy Learning},
author = {Meng Song and Xuezhi Wang and Tanay Biradar and Yao Qin and Manmohan Chandraker},
journal= {arXiv preprint arXiv:2405.06063},
year = {2024}
}