中文

实例更需细致对待:在循环中使用LLM重写提示词可为实例带来更佳零样本性能

计算与语言 2024-06-13 v4

摘要

大语言模型(LLMs)已经革新了零样本任务性能,减少了对任务特定标注的需求,同时增强了任务泛化能力。尽管取得了进展,当前使用如“让我们一步步思考”等触发短语的方法仍然有限。本研究提出PRomPTed,一种以“LLMs在循环中”的创新方式为单个任务实例优化零样本提示词的方法。我们基于GPT-4在13个数据集和10种任务类型上的综合评估显示,PRomPTed显著优于朴素零样本方法以及一个强基线(即“输出精炼”),该基线精炼任务输出而非输入提示词。我们的实验结果也确认了这一优势向相对较弱的GPT-3.5的泛化性。更有趣的是,我们发现利用GPT-3.5为更强的GPT-4重写提示词不仅匹敌、而且偶尔超越使用GPT-4作为提示词重写器的效果。因此,我们的研究不仅在提升零样本LLM性能方面具有巨大价值,也潜在实现了以较弱对手监督LLM,这一能力近来备受关注。最后,我们的附加实验确认了优势向开源LLM如Mistral 7B和Mixtral 8x7B的泛化性。

关键词

引用

@article{arxiv.2310.02107,
  title  = {Instances Need More Care: Rewriting Prompts for Instances with LLMs in the Loop Yields Better Zero-Shot Performance},
  author = {Saurabh Srivastava and Chengyue Huang and Weiguo Fan and Ziyu Yao},
  journal= {arXiv preprint arXiv:2310.02107},
  year   = {2024}
}

备注

Accepted at ACL 2024 - Findings