中文

如何不做基准测试:超越静态排行榜,迈向真实评估

机器学习 2025-10-09 v1 人工智能

摘要

迁移性估计指标用于在没有微调模型且没有访问源数据集的情况下,找到适用于给定目标任务的高性能预训练模型。尽管对开发此类指标的兴趣日益增长,但用于衡量其进展的基准测试大多未得到充分检视。本文通过经验性研究,揭示了广泛使用的基准设置的诸多局限性。我们认为,评估这些指标的基准本质上是有缺陷的。我们经验性地表明,这些基准的不切实际的模型空间和静态性能层次结构人为地抬高了现有指标的 perceived performance,以至于简单的数据集无关的启发式方法可以超过复杂方法。我们的分析揭示了当前评估协议与现实世界模型选择复杂性之间存在的关键断层。为此,我们提供了构建更稳健和更真实基准的具体建议,以引导未来研究朝着更有意义的方向发展。

关键词

引用

@article{arxiv.2510.06448,
  title  = {How NOT to benchmark your SITE metric: Beyond Static Leaderboards and Towards Realistic Evaluation},
  author = {Prabhant Singh and Sibylle Hess and Joaquin Vanschoren},
  journal= {arXiv preprint arXiv:2510.06448},
  year   = {2025}
}