中文

UPRISE:用于改进零样本评估的通用提示检索

计算与语言 2023-12-19 v4

摘要

大语言模型(LLMs)因其令人印象深刻的能力而广受欢迎,但对特定模型微调或特定任务提示工程的需求会阻碍其泛化能力。我们提出UPRISE(用于改进零样本评估的通用提示检索,Universal Prompt Retrieval for Improving zero-Shot Evaluation),它调优一个轻量且通用的检索器,可自动为给定的零样本任务输入检索提示。具体而言,我们在跨任务和跨模型场景中展示了通用性:检索器在多样化任务集上调优,但在未见任务类型上测试;我们使用一个小的冻结LLM,GPT-Neo-2.7B,来调优检索器,但在更大规模的不同的LLM上测试检索器,如BLOOM-7.1B、OPT-66B和GPT3-175B。此外,我们表明UPRISE在我们使用ChatGPT的实验中缓解了幻觉问题,暗示其有潜力改进即便是最强的LLM。我们的模型和代码可在https://github.com/microsoft/LMOps获取。

关键词

引用

@article{arxiv.2303.08518,
  title  = {UPRISE: Universal Prompt Retrieval for Improving Zero-Shot Evaluation},
  author = {Daixuan Cheng and Shaohan Huang and Junyu Bi and Yuefeng Zhan and Jianfeng Liu and Yujing Wang and Hao Sun and Furu Wei and Denvy Deng and Qi Zhang},
  journal= {arXiv preprint arXiv:2303.08518},
  year   = {2023}
}

备注

EMNLP 2023 Main Conference