中文

重复次数是否重要?提升 LLM 评估可靠性

人工智能 2025-09-30 v1 计算与语言

摘要

LLM 排行榜通常依赖于单次随机运行,但需要多少次重复才能得出可靠结论尚不明确。我们在 AI4Math 基准测试上对八个最先进模型进行了三次独立运行的重新评估。使用混合效应 logistic 回归、领域层次均值、排名不稳定性分析和运行间可靠性,我们评估了额外重复次数的价值。我们的发现表明,单次运行排行榜脆弱不稳:10/12 个切片(83%)至少有一个配对排名相对于三次运行的多数决定相互反转,尽管配对显著性的零符号翻转率为零,整体跨类相关性适中。对运行结果进行平均可获得适度的标准误收缩(约 5%),但排名收益显著;两次运行可消除约 83% 的单次运行反转。我们提供了面向实践者的成本敏感性指导:将评估视为实验,报告不确定性,并在随机解码下使用 ≥ 2 次重复。这些做法在提高鲁棒性的同时保持可行性,帮助小型团队实现可行操作,并帮助将模型比较与实际可靠性保持一致。

关键词

引用

@article{arxiv.2509.24086,
  title  = {Do Repetitions Matter? Strengthening Reliability in LLM Evaluations},
  author = {Miguel Angel Alvarado Gonzalez and Michelle Bruno Hernandez and Miguel Angel Peñaloza Perez and Bruno Lopez Orozco and Jesus Tadeo Cruz Soto and Sandra Malagon},
  journal= {arXiv preprint arXiv:2509.24086},
  year   = {2025}
}