关于机器学习排行榜自动生成的立场论文
计算与语言
2025-11-21 v2 统计方法学
摘要
机器学习研究的一项重要任务是对比先前工作,这通常通过机器学习排行榜来完成:即为具有可比条件的实验(如相同任务、数据集和指标)提供的表格概览。然而,文献量的不断增长为创建和维护这些排行榜带来了挑战。为减轻这一负担,研究人员开发了从研究论文中提取排行榜条目以实现排行榜自动整理的方法。然而,先前工作在问题框架上存在差异,这使得比较变得复杂并限制了实际应用。在本立场论文中,我们首次对自动排行榜生成(ALG)研究进行了概述,识别了其在假设、范围和输出格式上的根本差异。我们提出了一个ALG统一概念框架,以标准化ALG任务的定义。我们提供了ALG基准测试指南,包括促进公平、可复现评估的数据集和指标建议。最后,我们概述了ALG面临的挑战和新方向,例如倡导通过纳入所有已报告结果和更丰富的元数据来实现更广泛的覆盖。
引用
@article{arxiv.2505.17465,
title = {A Position Paper on the Automatic Generation of Machine Learning Leaderboards},
author = {Roelien C Timmer and Yufang Hou and Stephen Wan},
journal= {arXiv preprint arXiv:2505.17465},
year = {2025}
}