通过统一评估与分析改进基于概率的提示选择
计算与语言
2024-03-11 v2
摘要
先前关于大语言模型提示工程的工作引入了不同的无梯度、基于概率的提示选择方法,旨在为给定任务从候选提示中选出最优提示,但未能提供彼此之间全面而公平的比较。在本文中,我们提出一个统一框架,通过在 13 个常见且多样的 NLP 任务上进行大量实验,来解读和评估现有的基于概率的提示选择方法。我们发现,现有每种方法都可被解释为最大化输入与预测输出之间互信息(MI)方法的某种变体。利用这一发现,我们开发了若干其他的 MI 组合变体,并将预言提示选择方法的有效性从 87.79% 提升至 94.98%(以所选提示性能与最优预言提示性能之比衡量)。此外,考虑到所有方法都依赖于可能存在偏差的模型输出概率分布,我们提出一种称为边缘化校准(Calibration by Marginalization, CBM)的新型校准方法,该方法与现有方法正交,并将最佳方法的提示选择有效性提升至 96.85%,在未校准情况下达到了预言提示 F1 的 99.44%。
引用
@article{arxiv.2305.14877,
title = {Improving Probability-based Prompt Selection Through Unified Evaluation and Analysis},
author = {Sohee Yang and Jonghyeon Kim and Joel Jang and Seonghyeon Ye and Hyunji Lee and Minjoon Seo},
journal= {arXiv preprint arXiv:2305.14877},
year = {2024}
}
备注
TACL 2024 (Pre-MIT Press publication version)