中文

观点:在数据点少于几百个时,勿用于 LLM 评估中的中心极限定理

形式语言与自动机理论 2025-03-04 v1

摘要

对大型语言模型(LLM)进行严谨的统计评估,包括有效的误差棒和显著性检验,对于实现有意义且可靠的性能评估至关重要。当前,当报告此类统计措施时,通常依赖中心极限定理(CLT)。在本位论文中,我们主张当基准由数千个样本组成时,CLT 基于的方法对于不确定性量化是合适的,但在依赖较小规模、高度专业化基准的 LLM 评估中,CLT 基于的方法无法提供充分的不确定性估计。在这些小数据场景下,我们展示 CLT 基于的方法表现极差,通常会严重低估不确定性(即产生过小的误差棒)。我们提出替代方案,包括易于实现的频率主义和贝叶斯方法,这些方法在日益常见的场景中更为恰当。我们提供一个简单的 Python 库用于这些贝叶斯方法,地址为 https://github.com/sambowyer/bayes_evals。

关键词

引用

@article{arxiv.2503.01746,
  title  = {Lexicographic transductions of finite words},
  author = {Emmanuel Filiot and Pierre-Alain Reynier and Nathan Lhote},
  journal= {arXiv preprint arXiv:2503.01746},
  year   = {2025}
}