快速进步时代的高效终身模型评估
机器学习
2024-11-26 v2 计算机视觉与模式识别
摘要
标准化基准推动了机器学习的进步。然而,随着重复测试,算法过度利用基准的特异性,导致过拟合风险增加。在我们的工作中,我们试图通过编译不断扩展的大规模基准(称为终身基准)来缓解这一挑战。这些基准带来了一个主要挑战:在非常大的样本集上评估越来越多的模型的高昂成本。为了解决这一挑战,我们引入了一种高效的模型评估框架 Sort & Search (S&S),该框架利用动态规划算法选择性排名和子选择测试样本,从而复用先前评估过的模型。为了在大规模下测试我们的方法,我们创建了 Lifelong-CIFAR10 和 Lifelong-ImageNet,分别包含 169 万和 198 万个分类测试样本。对超过 31,000 个模型的广泛实证评估表明,S&S 实现了高效的近似精度测量,在单个 A100 GPU 上将计算成本从 180 GPU 天减少到 5 GPU 小时(约减少 1000 倍),同时具有低近似误差和小于 100MB 的内存成本。我们的工作还突显了当前精度预测指标的问题,表明需要转向样本级评估指标。我们希望展示我们的方法瓶颈主要在于将排序泛化到单一秩序之外,而非改进搜索,以此指导未来的研究。
引用
@article{arxiv.2402.19472,
title = {Efficient Lifelong Model Evaluation in an Era of Rapid Progress},
author = {Ameya Prabhu and Vishaal Udandarao and Philip Torr and Matthias Bethge and Adel Bibi and Samuel Albanie},
journal= {arXiv preprint arXiv:2402.19472},
year = {2024}
}
备注
Accepted as a conference paper at NeurIPS'24