中文

POSIX: 大语言模型的提示灵敏度指数

计算与语言 2024-10-07 v2 人工智能 机器学习

摘要

尽管大语言模型展现了惊人的能力,但它们对微小提示变体异常敏感,常常对提示中的微小变化(如拼写错误、措辞更改或提示模板)会生成显著不同的输出。然而,在评估 LLM 时,关注点往往仅集中在下游任务性能上,而鲜有人关注提示灵敏度。为填补这一空白,我们提出 POSIX - 一种 novel PrOmpt Sensitivity IndeX 作为提示灵敏度的可靠衡量标准,从而为 LLM 性能提供更全面的评估。POSIX 的核心思想是捕捉给定响应在替换相应提示为不同意图保持的提示后,对数概率的相对变化。我们提供了充分的实证证据,表明 POSIX 在捕捉提示灵敏度方面有效,并据此衡量和比较 various open-source LLMs 的提示灵敏度。我们发现,仅增加参数数量或指令调优并不一定能降低提示灵敏度,而添加一些 few-shot 示例,甚至只添加一个示例,几乎总能显著降低提示灵敏度。我们也发现,提示模板的变更在 MCQ 类型任务中导致最高灵敏度,而改写则在 open-ended 生成任务中导致最高灵敏度。我们的代码已开源于 https://github.com/kowndinya-renduchintala/POSIX。

关键词

引用

@article{arxiv.2410.02185,
  title  = {POSIX: A Prompt Sensitivity Index For Large Language Models},
  author = {Anwoy Chatterjee and H S V N S Kowndinya Renduchintala and Sumit Bhatia and Tanmoy Chakraborty},
  journal= {arXiv preprint arXiv:2410.02185},
  year   = {2024}
}

备注

EMNLP 2024 (Findings)