中文

PredictaBoard:评估LLM评分可预测性的基准测试

计算与语言 2025-06-18 v2 人工智能 机器学习

摘要

尽管大型语言模型(LLM)拥有令人印象深刻的技能,但它们常常会不可预测地失败,在甚至基本常识推理任务中也表现不稳定。这一不可预测性构成了确保其安全部署的重大挑战,因为识别并在可靠的"安全区"内运作对于减轻风险至关重要。为此,我们present了PredictaBoard,一个 novel 的协作基准框架,用于评估评分预测器(称为 assessors)的能力,使其能预见特定任务实例(即提示)中LLM错误。PredictaBoard通过考虑不同容忍错误下的拒绝率来评估LLM和 assessors 的配对。因此,PredictaBoard刺激了 developing 更好的 assessors 以及使LLM更具可预测性的研究,不仅提升平均性能。我们使用基线 assessors 和最先进的LLM进行示范性实验。PredictaBoard突显了除了性能之外还需评估可预测性的 critical need,为开发更安全的AI系统铺平了道路,其中错误不仅被最小化,而且被预见并有效缓解。我们的基准代码可在 https://github.com/Kinds-of-Intelligence-CFI/PredictaBoard 查阅。

关键词

引用

@article{arxiv.2502.14445,
  title  = {PredictaBoard: Benchmarking LLM Score Predictability},
  author = {Lorenzo Pacchiardi and Konstantinos Voudouris and Ben Slater and Fernando Martínez-Plumed and José Hernández-Orallo and Lexin Zhou and Wout Schellaert},
  journal= {arXiv preprint arXiv:2502.14445},
  year   = {2025}
}

备注

Accepted at ACL Findings 2025