PredictaBoard:评估LLM评分可预测性的基准测试
计算与语言
2025-06-18 v2 人工智能
机器学习
摘要
尽管大型语言模型(LLM)拥有令人印象深刻的技能,但它们常常会不可预测地失败,在甚至基本常识推理任务中也表现不稳定。这一不可预测性构成了确保其安全部署的重大挑战,因为识别并在可靠的"安全区"内运作对于减轻风险至关重要。为此,我们present了PredictaBoard,一个 novel 的协作基准框架,用于评估评分预测器(称为 assessors)的能力,使其能预见特定任务实例(即提示)中LLM错误。PredictaBoard通过考虑不同容忍错误下的拒绝率来评估LLM和 assessors 的配对。因此,PredictaBoard刺激了 developing 更好的 assessors 以及使LLM更具可预测性的研究,不仅提升平均性能。我们使用基线 assessors 和最先进的LLM进行示范性实验。PredictaBoard突显了除了性能之外还需评估可预测性的 critical need,为开发更安全的AI系统铺平了道路,其中错误不仅被最小化,而且被预见并有效缓解。我们的基准代码可在 https://github.com/Kinds-of-Intelligence-CFI/PredictaBoard 查阅。
引用
@article{arxiv.2502.14445,
title = {PredictaBoard: Benchmarking LLM Score Predictability},
author = {Lorenzo Pacchiardi and Konstantinos Voudouris and Ben Slater and Fernando Martínez-Plumed and José Hernández-Orallo and Lexin Zhou and Wout Schellaert},
journal= {arXiv preprint arXiv:2502.14445},
year = {2025}
}
备注
Accepted at ACL Findings 2025