通过低秩分解进行大语言模型评估的最佳模型识别
机器学习
2026-05-12 v1
摘要
为固定基准挑选最佳大语言模型(LLM)往往昂贵,因为需要在每个示例上运行每个模型。多臂老虎机(MAB)算法可以通过顺序选择下一个模型-示例对来减少LLM调用次数,从而避免对明显表现不佳的模型进行浪费评估。通过使用低秩分解从部分观察到的模型-示例评分矩阵中预测模型得分可以实现进一步的节省。然而,这些预测并非真实值:它们可能具有偏差,因此可能导致最佳模型的错误识别。本文提出了一种原则性的框架,将MAB与廉价预测得分结合起来,而不会损害统计有效性。具体而言,我们推导了使用低秩预测来减少方差的每个模型性能的双鲁棒估计器。这使得在模型自适应选择且示例在无替换条件下抽样的setting下构建有效的有限样本置信区间成为可能。在真实基准上的实验结果表明,我们的方法减少了所需评估的次数,在计算和成本方面实现了实质性节省,同时准确识别最佳表现模型。
引用
@article{arxiv.2605.10405,
title = {Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization},
author = {Elad Tolochinsky and Yaniv Tenzer and Yaniv Romano},
journal= {arXiv preprint arXiv:2605.10405},
year = {2026}
}