中文

面向大型语言模型的层次化不确定概率可靠性评估框架

软件工程 2026-01-30 v2 人工智能

摘要

大型语言模型(LLMs)正在跨越多个领域部署,导致需要严格的可靠性评估方法。现有的基于基准的评估主要提供模型准确率在数据集上的描述性统计,为何在实际运行条件下 LLMs 的概率行为提供有限的见解。本文引入 HIP-LLM(Hierarchical Imprecise Probability framework),用于建模和推断 LLM 可靠性。基于软件可靠性工程的基础,HIP-LLM 将 LLM 可靠性定义为在给定操作概要(OP)下,基于指定任务数量在未来进行无故障操作的概率。HIP-LLM 以层次结构表示(子)域之间的依赖关系,使能够从子域到系统级可靠性进行多层次推理。HIP-LLM 嵌入不确定先验以捕捉认识不确定性,并包含 OP 以反映使用情境。它推导出可靠性置信区间,对先验和数据之间的不确定性进行量化。来自多个基准数据集的实验表明,HIP-LLM 在可靠性特征描述方面比现有的基准方法和最先进的方法更准确且更标准化。提供了一个公开可访问的 HIP-LLM 存储库。

关键词

引用

@article{arxiv.2511.00527,
  title  = {A Hierarchical Imprecise Probability Approach to Reliability Assessment of Large Language Models},
  author = {Robab Aghazadeh-Chakherlou and Qing Guo and Siddartha Khastgir and Peter Popov and Xiaoge Zhang and Xingyu Zhao},
  journal= {arXiv preprint arXiv:2511.00527},
  year   = {2026}
}

备注

under review