HiBayES:面向 AI 评估统计的层次贝叶斯建模框架
人工智能
2025-07-15 v3 应用统计
摘要
随着大型语言模型(LLM)及其他人工智能系统的演化,对其能力的鲁健估计变得越来越重要,同时系统性地量化这些估计的不确定性也日益紧迫。此外,高级 AI 评估往往具有嵌套的层次结构、高度复杂性,并且在测试最先进的人工智能系统时成本极高。为此,我们引入 HiBayES,一个通用的层次贝叶斯建模框架,用于 AI 评估统计。HiBayES 支持对经典问答基准测试和先进的 agentic 评估进行稳健推断,特别适用于数据稀缺的场景(例如,每项评估不到 20 个数据点)。基于广义线性模型(GLM)、贝叶斯数据分析和形式模型比较,HiBayES 提供原则性的不确定性量化和稳健的参数估计。本文提供 HiBayES 的全面介绍,包括示例、与传统统计方法的比较以及实施多层贝叶斯 GLM 的实用指导。此外,我们提供一个 HiBayES 软件包[4](Beta 版),可即插即用地实现。
引用
@article{arxiv.2505.05602,
title = {HiBayES: A Hierarchical Bayesian Modeling Framework for AI Evaluation Statistics},
author = {Lennart Luettgau and Harry Coppock and Magda Dubois and Christopher Summerfield and Cozmin Ududec},
journal= {arXiv preprint arXiv:2505.05602},
year = {2025}
}
备注
23 pages, 9 figures