面向评估工程的探索:野外 ML 评估套件的实证研究
软件工程
2026-05-26 v1 人工智能
机器学习
摘要
评估套件是软件系统,用于通过管理模型调用、数据加载、指标计算和结果报告来协调模型评估。尽管它们在机器学习基础设施中发挥着关键作用,但其操作挑战和工程关注事项迄今为止获得了有限的注意。我们对 57 个评估套件进行了实证研究,推导出五阶段套件模型,并对 16,560 个问题按工作流程阶段和根本原因进行分类。大多数评估套件操作挑战集中在 Specification 阶段(占问题的 41.4%),该阶段套件集成外部模型、数据集和评分评判员。三个最常见的根本原因是未实现的功能(24.3%)、文档缺口(20.3%)和缺失输入验证(17.2%),这三者合计占分类问题的 61.7%,涵盖现有功能的缺陷以及阻止预期工作流程的能力缺口。根本原因也因工作流程阶段而异:环境不兼容和外部依赖关系中断占 provisioning 问题的 36.2%,而算法错误(25.9%)和验证缺口(22.5%)占 assessment 问题的比重最大。总体而言,这些贡献为将评估工程视为一个独特的软件工程关注事项奠定了实证基础。
引用
@article{arxiv.2605.24213,
title = {Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild},
author = {Zhimin Zhao and Zehao Wang and Abdul Ali Bangash and Bram Adams and Ahmed E. Hassan},
journal= {arXiv preprint arXiv:2605.24213},
year = {2026}
}