用更少项目获得可信排名:基于连续分数的自适应大语言模型评估
计算与语言
2026-01-21 v1 人工智能
摘要
计算机自适应测试(CAT)已被证明能有效用于多项选择基准上的高效大语言模型(LLM)评估,但现代LLM评估越来越依赖于生成任务,其输出是连续评分而非简单的正确/错误标记。我们通过用异方差正态分布替换伯努利响应分布,将基于项目反应理论(IRT)的自适应测试原则性地扩展到连续有界分数(ROUGE、BLEU、LLM-as-a-Judge)。在此基础上,我们引入了一种具有自适应停止标准的不确定性感知排序器,该排序器在测试尽可能少的项目和尽可能低的成本下实现可靠的模型排名。我们在涵盖基于n-gram、基于嵌入和LLM-as-judge指标的五项基准上验证了我们的方法。我们的方法使用了2%的项目,同时将排名相关性比随机采样提高了0.12 {\tau},并且在可信预测上达到了95%的准确率。
引用
@article{arxiv.2601.13885,
title = {Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores},
author = {Esma Balkır and Alice Pernthaller and Marco Basaldella and José Hernández-Orallo and Nigel Collier},
journal= {arXiv preprint arXiv:2601.13885},
year = {2026}
}