中文

DOVE:面向有意义 LLM 评估的大规模多维预测数据集

计算与语言 2026-04-07 v4

摘要

近期的研究发现,LLM 对各种任意提示维度敏感,包括分隔符类型、答案枚举方式、指令措辞等等。这对流行的单提示评估实践提出了质疑。我们提出了 DOVE(Dataset Of Variation Evaluation),一个包含多种评估基准提示扰动的大规模数据集。与之前的工作不同,我们从整体视角考察 LLM 的敏感性,并评估扰动在各种维度上的联合效应,每个实例产生数千个扰动。我们对几组模型家族进行评估,导致了若干发现,包括选择高性能提示的有效方法、观察到 few-shot 示例可降低敏感性,以及识别在所有扰动下都难以解决的实例。DOVE 包含超过 2.5 亿个提示扰动和模型输出,我们将其公开,以推动社区-wide 努力,以实现有意义的、稳健的和高效的评估。浏览数据、贡献、更多信息:https://slab-nlp.github.io/DOVE/。

关键词

引用

@article{arxiv.2503.01622,
  title  = {DOVE: A Large-Scale Multi-Dimensional Predictions Dataset Towards Meaningful LLM Evaluation},
  author = {Eliya Habba and Ofir Arviv and Itay Itzhak and Yotam Perlitz and Elron Bandel and Leshem Choshen and Michal Shmueli-Scheuer and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2503.01622},
  year   = {2026}
}