一次性评估多个问题的LLM
人工智能
2025-06-24 v3 计算与语言
摘要
本文展示了同时评估LLM多个问题的益处和成效,我们将这种范式称为多问题评估(MPE)。与传统的单问题评估(即一个提示提出单个问题并期望一个特定答案)不同,MPE将多个问题放在同一个提示中,并评估LLM在单个输出中回答所有这些问题的能力。利用已有的6个分类基准和12个推理基准,我们引入了一个名为ZeMPE(零样本多问题评估)的新基准,包含53,100个零样本多问题提示。我们对来自5个模型家族的共13个LLM在ZeMPE上进行了实验,以提供全面且系统的MPE。我们的结果表明,LLM能够像分别处理来自单个数据源的多个问题一样处理它们,但在某些条件下,这种多问题处理能力会有所欠缺。此外,我们进行了深入的进一步分析,并探索了可能使LLM具备多问题处理能力的模型层面因素。我们发布了语料库和代码以促进未来的研究。
引用
@article{arxiv.2406.10786,
title = {Evaluating LLMs with Multiple Problems at once},
author = {Zhengxiang Wang and Jordan Kodner and Owen Rambow},
journal= {arXiv preprint arXiv:2406.10786},
year = {2025}
}
备注
22 pages, 9 figures, 12 tables