中文

BatchPrompt:以更少代价完成更多任务

计算与语言 2024-07-16 v3

摘要

随着大语言模型(LLM)不断增长的 token 上限已支持长上下文作为输入,以单个数据样本进行提示可能不再是一种高效方式。一种提升效率的直接策略是在 token 限制内(例如 gpt-3.5-turbo 为 8k;GPT-4 为 32k)对数据进行批处理,我们称之为 BatchPrompt。对于批处理数据的提示,我们有两点初步观察。首先,我们发现与单数据提示相比,在更长上下文中使用批处理数据进行提示不可避免地导致更差的性能。其次,由于解码器上下文的相应变化,语言模型的性能与批处理数据的位置和顺序显著相关。为保持效率并克服性能损失,我们提出了批处理排列与集成(BPE),以及一种新颖的自反思引导早停(SEAS)技术。我们全面的实验评估表明,BPE 能在一系列流行 NLP 任务上以惊人幅度提升 BatchPrompt 的性能,包括问答(Boolq)、文本蕴含(RTE)和重复问题识别(QQP)。这些性能甚至可与单数据提示(SinglePrompt)竞争或更高,而 BatchPrompt 所需的 LLM 调用和输入 token 少得多(对于 SinglePrompt 与批大小为 32 的 BatchPrompt,仅使用 9%–16% 的 LLM 调用次数,Boolq 准确率从 90.6% 到 90.9% 且使用 27.4% 的 token,QQP 准确率从 87.2% 到 88.4% 且使用 18.6% 的 token,RTE 准确率从 91.5% 到 91.1% 且使用 30.8% 的 token)。据我们所知,这是首项从技术上提升大语言模型提示效率的工作。我们希望这一简单而有效的方法能为大语言模型的未来研究提供启发。代码将公开。

关键词

引用

@article{arxiv.2309.00384,
  title  = {BatchPrompt: Accomplish more with less},
  author = {Jianzhe Lin and Maurice Diesendruck and Liang Du and Robin Abraham},
  journal= {arXiv preprint arXiv:2309.00384},
  year   = {2024}
}

备注

20 pages, 5 figures