中文

HiBayES:面向 AI 评估统计的层次贝叶斯建模框架

人工智能 2025-07-15 v3 应用统计

摘要

随着大型语言模型(LLM)及其他人工智能系统的演化,对其能力的鲁健估计变得越来越重要,同时系统性地量化这些估计的不确定性也日益紧迫。此外,高级 AI 评估往往具有嵌套的层次结构、高度复杂性,并且在测试最先进的人工智能系统时成本极高。为此,我们引入 HiBayES,一个通用的层次贝叶斯建模框架,用于 AI 评估统计。HiBayES 支持对经典问答基准测试和先进的 agentic 评估进行稳健推断,特别适用于数据稀缺的场景(例如,每项评估不到 20 个数据点)。基于广义线性模型(GLM)、贝叶斯数据分析和形式模型比较,HiBayES 提供原则性的不确定性量化和稳健的参数估计。本文提供 HiBayES 的全面介绍,包括示例、与传统统计方法的比较以及实施多层贝叶斯 GLM 的实用指导。此外,我们提供一个 HiBayES 软件包[4](Beta 版),可即插即用地实现。

关键词

引用

@article{arxiv.2505.05602,
  title  = {HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics},
  author = {Lennart Luettgau and Harry Coppock and Magda Dubois and Christopher Summerfield and Cozmin Ududec},
  journal= {arXiv preprint arXiv:2505.05602},
  year   = {2025}
}

备注

23 pages, 9 figures