仅凭有限观察即可进行精确模型基准测试
机器学习
2024-10-08 v1 计算与语言
计算机视觉与模式识别
应用统计
摘要
我们如何能精确估计大型语言模型 (LLM) 在特定主题所属问题的准确率,这些问题属于更大问题-答案数据集中的子集?标准的直接估计器对每个子组 (主题) 中的问题准确率进行平均,可能在样本量较小的子组上表现出高方差。合成回归建模利用模型对其他主题问题的准确率,可能产生偏差较大的估计,且对大型子组不够可靠。我们提出一种简单而有效的解决方案:一种经验贝叶斯 (EB) 估计器,通过分别平衡每个子组的直接估计和回归估计,从而提高子组层面模型性能估计的精度。我们在多个数据集上的实验表明,该方法在所有实验中均能提供比直接和回归方法更精确的 LLM 性能估计,显著降低均方误差。EB 估计的置信区间覆盖率接近理论值,且比直接估计器的置信区间更窄。此外,在表格数据和视觉数据上的额外实验验证了该 EB 方法的优势。
引用
@article{arxiv.2410.05222,
title = {Precise Model Benchmarking with Only a Few Observations},
author = {Riccardo Fogliato and Pratik Patil and Nil-Jana Akpinar and Mathew Monfort},
journal= {arXiv preprint arXiv:2410.05222},
year = {2024}
}
备注
To appear at EMNLP 2024