中文

机器学习基准中聚合绩效指标的统计不确定性量化

机器学习 2025-01-09 v1 机器学习 应用统计

摘要

现代人工智能依赖于预训练于大规模数据语料库后再适应解决各种下游任务的机器学习模型(如基础模型)。为总结跨多个任务的性能,评估指标常被聚合为汇总指标,如跨10个问答任务的平均准确率。聚合评估指标时,纳入汇总指标的不确定性有助于更真实地理解模型性能。本文旨在演示如何使用统计方法对跨多个任务聚合的指标进行不确定性量化。我们强调的方法包括自助法(bootstrapping)、贝叶斯层次(多层)建模以及考虑标准误的任务权重可视化。这些技术揭示了诸如特定类型任务中特定模型占主导地位尽管整体表现较差等洞见。我们使用流行的机器学习基准——视觉任务适应基准(VTAB)来演示我们方法的有用性。

关键词

引用

@article{arxiv.2501.04234,
  title  = {Statistical Uncertainty Quantification for Aggregate Performance Metrics in Machine Learning Benchmarks},
  author = {Rachel Longjohn and Giri Gopalan and Emily Casleton},
  journal= {arXiv preprint arXiv:2501.04234},
  year   = {2025}
}

备注

LA-UR-24-25289; presented at the Workshop on Statistical Frontiers in LLMs and Foundation Models at NeurIPS 2024