DISCO:用于高效模型评估的样本浓缩多样化
机器学习
2026-03-03 v2 人工智能
摘要
评估现代机器学习模型已变得昂贵。诸如 LMMs-Eval 和 HELM 等基准需要数千个 GPU 小时。成本高昂的评估降低了包容性,减缓了创新周期,并加剧了环境影响。典型方法包含两个步骤:首先选择锚点子集数据,其次训练从该子集上的准确率到最终测试结果的映射。其缺点是锚点选择依赖于聚类,这可能复杂且对设计选择敏感。我们认为,促进样本之间的多样性并非关键;重要的是选择能够最大化模型响应多样性的样本。我们的方法是 ,通过挑选具有最大模型不一致性的前 k 个样本来实现这一点。这使用贪心、样本级统计,而非全局聚类。该方法在概念上更为简单。从理论角度看,样本间的模型不一致提供了一种信息论上最优的贪心选择规则。 在实验中显示出超过先前方法的性能提升,在 MMLU、Hellaswag、Winogrande 和 ARC 上实现了性能预测的状态-of-the-art 结果。代码可在 https://github.com/arubique/disco-public 查找。
引用
@article{arxiv.2510.07959,
title = {DISCO: Diversifying Sample Condensation for Efficient Model Evaluation},
author = {Alexander Rubinstein and Benjamin Raible and Martin Gubri and Seong Joon Oh},
journal= {arXiv preprint arXiv:2510.07959},
year = {2026}
}
备注
ICLR'26; arXiv v2: add camera-ready