中文

ProSA:评估与理解大语言模型的提示敏感性

计算与语言 2024-10-17 v1

摘要

大语言模型 (LLM) 在各类任务上展现出惊人的能力,但其性能对所使用的提示 (prompt) 高度敏感。这种变异性给准确评估和用户满意度带来了挑战。当前研究常常忽略实例级别的提示变异及其对主观评估的影响。为此,我们引入 ProSA 框架,用于评估和理解 LLM 的提示敏感性。ProSA 包含一种新颖的敏感性度量指标 PromptSensiScore,并利用解码置信度阐释其背后机制。我们的广泛研究覆盖多个任务,发现提示敏感性在不同数据集和模型之间会有所波动,较大的模型显示出更好的鲁棒性。我们观察到,few-shot 示例可缓解此类敏感性问题,主观评估也会受到提示敏感性的影响,尤其是在复杂且以推理为导向的任务上。进一步地,我们的发现表明,更高的模型置信度与更强的提示鲁棒性相关。我们认为本工作将为研究 LLM 的提示敏感性提供有用的工具。项目已发布于 https://github.com/open-compass/ProSA。

关键词

引用

@article{arxiv.2410.12405,
  title  = {ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs},
  author = {Jingming Zhuo and Songyang Zhang and Xinyu Fang and Haodong Duan and Dahua Lin and Kai Chen},
  journal= {arXiv preprint arXiv:2410.12405},
  year   = {2024}
}

备注

EMNLP 2024, Findings