高效的多提示LLM评估方法
计算与语言
2024-11-01 v3 人工智能
机器学习
机器学习
摘要
大多数流行的LLM基准测试依赖于有限的提示模板,这可能无法完全捕捉LLM的能力,并可能影响排行榜上结果的可重复性。许多近期工作经验验证了提示敏感性,并呼吁更改LLM评估。在本文中,我们考虑在众多提示变体中估算性能分布,而不是寻找单一提示进行评估的问题。我们引入 PromptEval 方法,通过在提示和示例之间借助力量,对大量提示集合中的性能进行估计,以在实际评估预算下获得准确的估计。 resulting distribution 可用于获取性能分位值,以构建各种稳健的性能指标(例如,top 95% 分位值或中位数)。我们证明 PromptEval 在一致性估计性能分布方面具有优势,并通过在三个突出LLM基准测试(MMLU、BIG-bench Hard 和 LMentry)上的实证研究证明了其有效性;例如,PromptEval 可在相当于两个单提示评估的预算下,准确估计 MMLU 上 100 个提示模板的性能分位值。此外,我们展示了 PromptEval 在 LLM-as-a-judge 和最佳提示识别等应用中的用途。
引用
@article{arxiv.2405.17202,
title = {Efficient multi-prompt evaluation of LLMs},
author = {Felipe Maia Polo and Ronald Xu and Lucas Weber and Mírian Silva and Onkar Bhardwaj and Leshem Choshen and Allysson Flavio Melo de Oliveira and Yuekai Sun and Mikhail Yurochkin},
journal= {arXiv preprint arXiv:2405.17202},
year = {2024}
}
备注
NeurIPS 2024