中文

ReliableEval:基于矩方法的随机LLM评估方案

计算与语言 2025-09-16 v2

摘要

LLM对提示词的表述高度敏感,然而标准基准测试通常仅使用单一提示词报告性能,这引发了对此类评估可靠性的担忧。在本文中,我们主张在保持语义不变的提示词扰动空间上采用随机矩方法进行评估。我们引入了考虑提示词敏感性的可靠评估的形式化定义,并提出了ReliableEval——一种用于估计获得有意义结果所需提示词重采样次数的方法。利用我们的框架,我们对五个前沿LLM进行了随机评估,发现即使是像GPT-4o和Claude-3.7-Sonnet这样的高性能模型也表现出显著的提示词敏感性。我们的方法与模型、任务和指标无关,为有意义且稳健的LLM评估提供了一套方案。

关键词

引用

@article{arxiv.2505.22169,
  title  = {ReliableEval: A Recipe for Stochastic LLM Evaluation via Method of Moments},
  author = {Gili Lior and Eliya Habba and Shahar Levy and Avi Caciularu and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2505.22169},
  year   = {2025}
}

备注

Findings of EMNLP 2025