TEMPERA:基于强化学习的测试时提示编辑
计算与语言
2022-11-23 v1 人工智能
摘要
精细的提示设计对于大语言模型在零样本或少样本学习中的使用至关重要。因此,人们对自动设计最优提示的方法日益关注。本工作中,我们提出测试时提示编辑使用强化学习(TEMPERA)。与先前的提示生成方法不同,TEMPERA能高效利用先验知识,自适应不同查询,并为每个查询提供可解释的提示。为此,我们设计了一种新颖的动作空间,允许对初始提示进行灵活编辑,涵盖指令、少样本示例和言语化器等常用组件。所提方法在情感分析、主题分类、自然语言推理和阅读理解等多种任务上,相比prompt tuning、AutoPrompt和RLPrompt等近期SOTA方法取得了显著增益。与传统微调方法相比,我们的方法在样本效率上平均实现了5.33倍的提升。
引用
@article{arxiv.2211.11890,
title = {TEMPERA: Test-Time Prompting via Reinforcement Learning},
author = {Tianjun Zhang and Xuezhi Wang and Denny Zhou and Dale Schuurmans and Joseph E. Gonzalez},
journal= {arXiv preprint arXiv:2211.11890},
year = {2022}
}